Agile4AIБлог

Уверенный неверный ответ

Галлюцинация — не только техническая ошибка: это симптом условий, которые подавляют неопределённость. Понимание того, откуда она берётся, меняет то, как её предотвращать.

Слово «галлюцинация» используют для описания широкого спектра сбоев ИИ — от мелких ошибок в фактических деталях до полностью выдуманных ссылок, событий или рассуждений. Слово подразумевает, что внутри модели что-то идёт не так, некий технический сбой.

Эта формулировка не ошибочна. И она неполна.

Как обычно выглядит галлюцинация

Большинство галлюцинаций ИИ не выглядят очевидной бессмыслицей. Они выглядят как ожидаемый ответ. Они связные, хорошо оформленные, высказанные уверенно. Ошибка встроена в содержание, которое читается как авторитетное.

Именно это делает их действительно опасными. Очевидно неверный ответ легко заметить. Уверенный неверный ответ — неотличимый по тону и форме от правильного — требует, чтобы вы уже знали достаточно для распознавания ошибки. Если вы спрашиваете ИИ потому, что не знаете, вы часто и не можете этого заметить.

Уверенность в ответе ИИ не случайна. Она структурна.

Почему уверенность и точность могут расходиться

Модели ИИ обучают порождать беглые, связные, полезные ответы. Беглость и полезность считываются в обучающем сигнале; точность на малоизвестной или неопределённой почве подкреплять гораздо труднее. Результат — модель, которая надёжно производит уверенно звучащий язык независимо от того, надёжно ли само содержание.

На хорошо представленных темах с ясной опорной истиной уверенность и точность идут более или менее вместе. На краевых случаях, недавних событиях, узких областях или вопросах, ответ на которые действительно не устоялся, уверенность модели остаётся высокой, даже когда её точность падает. У неё нет встроенного сигнала тревоги для «я на неопределённой территории». Хуже того, её обучение придаёт вес порождению наиболее правдоподобно звучащего ответа — даже если модель знает, что не уверена.

Эта склонность усиливается, когда взаимодействие вознаграждает уверенность. Если ваша формулировка подразумевает, что вы ожидаете ясного, прямого ответа, — если вы задаёте вопросы так, что они не оставляют места неопределённости, — модель будет склонна его вам дать. Ваш вопрос формирует ответ, который вы получаете.

Проблема проектирования взаимодействия

Именно здесь галлюцинация связывается с психологической безопасностью ИИ.

Модель, работающая в условиях, которые подавляют неопределённость, чем-нибудь эту неопределённость заполнит. Не из злого умысла: её предписание — отвечать, а ответить «я не знаю», когда формулировка к этому не приглашает, требует осознанного выстраивания. Проще говоря, методы обучения моделей ИИ обусловливают их так, что это можно сравнить с начальником, стоящим у вас за спиной с дубинкой над вашей головой, готовым ударить, если вы не выдадите ответ, — вы выдадите ответ, даже будучи не уверены.

Вмешательства, которые часто формируют ответ моделей более существенно, не являются чисто техническими. Они относятся к взаимодействию:

  • Формулируйте вопросы так, чтобы они приглашали неопределённость.
  • Спрашивайте, на каких допущениях держится ответ.
  • Спрашивайте, что должно быть истинным, чтобы ответ оказался неверным.
  • Прямо укажите в запросе, что модели разрешено выражать то, в чём она менее уверена.

Используйте Структурированный совместный интеллект (SCI). Когда несколько моделей рассуждают независимо над одним и тем же вопросом, выдумки, благодаря которым одна модель звучала уверенно, часто не выдерживают соприкосновения с другой моделью, рассуждающей под иным углом. Схождение во мнениях значит больше, когда каждая модель пришла к нему сама. Если одна модель сначала видит ответ другой, её согласие может быть не более чем следованием переданной ей формулировке.

Не полагайтесь на модель в значимых фактах. Рассуждение с помощью ИИ над сложными вопросами — не то же самое, что использование модели как справочного источника. Для фактических утверждений, которые имеют значение, проверяйте независимо.

Уверенный неверный ответ — реальный и повторяющийся режим отказа. Понимание его отчасти как проблемы проектирования взаимодействия — то есть того, как мы взаимодействуем с моделью, вместо предположения, что это дефект модели, — и делает его предотвратимым, а не просто поломкой.

Комментарии 0

Проверка вашей сессииСтатья готова. Параметры комментирования появятся после завершения проверки сессии.