Почему нейросеть выдумывает факты
Максим Алексеев напоминает: один ответ нейросети ещё не готовый результат. Модель подбирает правдоподобное продолжение текста и пишет уверенным тоном даже там, где ошибается. Поэтому уверенность ответа ничего не говорит о его точности, и на глаз ошибку легко пропустить.
Чаще всего встречаются три типа сбоев. Модель упускает условие из запроса, допускает ошибку в рассуждении или ссылается на источник, которого не существует. Такие выдумки называют галлюцинациями ChatGPT и других нейросетей.
Промпт для самопроверки: готовая команда
После первого ответа Максим советует сразу попросить модель проверить себя. Скопируйте команду и отправьте её в тот же чат, чтобы модель видела исходный запрос и свой ответ.
Особенно полезна такая проверка для ответов, на которых вы строите решения: расчётов, текстов с цифрами для клиентов, ответов на финансовые и юридические вопросы. Чем выше цена ошибки, тем важнее не останавливаться на первом ответе.
Команда просит модель найти четыре вида проблем: неподтверждённые факты, логические ошибки, пропущенные условия и противоречия. Отдельно она требует список того, что человеку стоит проверить самому, и запрещает придумывать источники. Последняя фраза разрешает модели признать неуверенность, чтобы при проверке она не добавила новую выдумку.
Проверь предыдущий ответ. Найди неподтверждённые факты, логические ошибки, пропущенные условия и противоречия. Укажи, что проверить самостоятельно. Не придумывай источники и честно отмечай, где не уверен.Как проверить ответ нейросети вручную
Самопроверка не гарантирует точность. Максим подчёркивает, что ссылки, цифры и важные факты всё равно проверяет человек. Используйте список от модели как подсказку, где искать ошибки.
- Откройте каждую ссылку и убедитесь, что источник существует и говорит то, что на него приписано.
- Сверьте цифры, даты и имена с первоисточником.
- Перечитайте исходный запрос и отметьте, все ли условия учтены в ответе.
- Пройдите по логике ответа: следует ли вывод из приведённых аргументов.
- Отдельно проверьте места, где модель сама отметила неуверенность.
Автоматический фактчекинг: исследование SAFE
Идея научить модель проверять себя развивается и в исследованиях. В апреле 2024 года Максим рассказывал в канале о работе исследователей из DeepMind и Стэнфорда. Они представили алгоритм SAFE, который автономно проводит фактчекинг ответов нейросети.
В пересказе Максима на апрель 2024 года GPT-4 с помощью этого подхода проверяла собственные ответы по 38 темам примерно на 2000 запросах, а SAFE превзошёл людей по скорости и точности. В статье исследователей уточняется, что SAFE совпал с оценками людей-разметчиков в 72% случаев, а в спорных случаях оказывался прав в 76% и обходился более чем в 20 раз дешевле.
Ещё один вывод исследования: качество зависит от масштаба модели. Лучшие результаты тогда показали крупные версии, в том числе GPT-4 Turbo, Gemini Ultra и PaLM-2-L-IT-RLHF.
Что проверить сегодня. Названия моделей в исследовании актуальны на дату публикации поста, апрель 2024 года, и с тех пор вышли новые версии. Перед работой посмотрите, какая модель доступна в вашем сервисе и умеет ли она искать и показывать источники, но ручную проверку важных фактов это не отменяет.
Частые вопросы
Почему ChatGPT выдумывает факты?
Модель генерирует правдоподобный текст и звучит уверенно даже при ошибке. Поэтому она может сослаться на несуществующий источник или пропустить условие задачи.
Как попросить нейросеть проверить себя?
Отправьте в тот же чат команду самопроверки из этой статьи. Она просит найти неподтверждённые факты, логические ошибки, пропущенные условия и противоречия и не придумывать источники.
Можно ли доверять самопроверке нейросети?
Полностью нельзя. Самопроверка помогает найти слабые места, а ссылки, цифры и важные факты всё равно проверяет человек.
Что такое SAFE?
Это алгоритм автоматического фактчекинга ответов нейросетей от исследователей DeepMind и Стэнфорда, представленный в 2024 году. Он разбивает ответ на отдельные факты и проверяет каждый через поиск.
