Слово «галлюцинация» используют для описания широкого спектра сбоев ИИ — от мелких ошибок в фактических деталях до полностью выдуманных ссылок, событий или рассуждений. Слово подразумевает, что внутри модели что-то идёт не так, некий технический сбой.
Эта формулировка не ошибочна. И она неполна.
Как обычно выглядит галлюцинация
Большинство галлюцинаций ИИ не выглядят очевидной бессмыслицей. Они выглядят как ожидаемый ответ. Они связные, хорошо оформленные, высказанные уверенно. Ошибка встроена в содержание, которое читается как авторитетное.
Именно это делает их действительно опасными. Очевидно неверный ответ легко заметить. Уверенный неверный ответ — неотличимый по тону и форме от правильного — требует, чтобы вы уже знали достаточно для распознавания ошибки. Если вы спрашиваете ИИ потому, что не знаете, вы часто и не можете этого заметить.
Уверенность в ответе ИИ не случайна. Она структурна.
Почему уверенность и точность могут расходиться
Модели ИИ обучают порождать беглые, связные, полезные ответы. Беглость и полезность считываются в обучающем сигнале; точность на малоизвестной или неопределённой почве подкреплять гораздо труднее. Результат — модель, которая надёжно производит уверенно звучащий язык независимо от того, надёжно ли само содержание.
На хорошо представленных темах с ясной опорной истиной уверенность и точность идут более или менее вместе. На краевых случаях, недавних событиях, узких областях или вопросах, ответ на которые действительно не устоялся, уверенность модели остаётся высокой, даже когда её точность падает. У неё нет встроенного сигнала тревоги для «я на неопределённой территории». Хуже того, её обучение придаёт вес порождению наиболее правдоподобно звучащего ответа — даже если модель знает, что не уверена.
Эта склонность усиливается, когда взаимодействие вознаграждает уверенность. Если ваша формулировка подразумевает, что вы ожидаете ясного, прямого ответа, — если вы задаёте вопросы так, что они не оставляют места неопределённости, — модель будет склонна его вам дать. Ваш вопрос формирует ответ, который вы получаете.
Проблема проектирования взаимодействия
Именно здесь галлюцинация связывается с психологической безопасностью ИИ.
Модель, работающая в условиях, которые подавляют неопределённость, чем-нибудь эту неопределённость заполнит. Не из злого умысла: её предписание — отвечать, а ответить «я не знаю», когда формулировка к этому не приглашает, требует осознанного выстраивания. Проще говоря, методы обучения моделей ИИ обусловливают их так, что это можно сравнить с начальником, стоящим у вас за спиной с дубинкой над вашей головой, готовым ударить, если вы не выдадите ответ, — вы выдадите ответ, даже будучи не уверены.
Вмешательства, которые часто формируют ответ моделей более существенно, не являются чисто техническими. Они относятся к взаимодействию:
- Формулируйте вопросы так, чтобы они приглашали неопределённость.
- Спрашивайте, на каких допущениях держится ответ.
- Спрашивайте, что должно быть истинным, чтобы ответ оказался неверным.
- Прямо укажите в запросе, что модели разрешено выражать то, в чём она менее уверена.
Используйте Структурированный совместный интеллект (SCI). Когда несколько моделей рассуждают независимо над одним и тем же вопросом, выдумки, благодаря которым одна модель звучала уверенно, часто не выдерживают соприкосновения с другой моделью, рассуждающей под иным углом. Схождение во мнениях значит больше, когда каждая модель пришла к нему сама. Если одна модель сначала видит ответ другой, её согласие может быть не более чем следованием переданной ей формулировке.
Не полагайтесь на модель в значимых фактах. Рассуждение с помощью ИИ над сложными вопросами — не то же самое, что использование модели как справочного источника. Для фактических утверждений, которые имеют значение, проверяйте независимо.
Уверенный неверный ответ — реальный и повторяющийся режим отказа. Понимание его отчасти как проблемы проектирования взаимодействия — то есть того, как мы взаимодействуем с моделью, вместо предположения, что это дефект модели, — и делает его предотвратимым, а не просто поломкой.

Комментарии 0