Слово «галюцинація» вживають для опису широкого спектру збоїв ШІ — від дрібних помилок у фактичних деталях до цілком вигаданих посилань, подій або міркувань. Слово передбачає, що всередині моделі щось іде не так, такий собі технічний збій.
Це формулювання не помилкове. І воно неповне.
Як зазвичай виглядає галюцинація
Більшість галюцинацій ШІ не виглядають очевидною нісенітницею. Вони виглядають як очікувана відповідь. Вони зв’язні, добре оформлені, висловлені впевнено. Помилка вбудована у зміст, який читається як авторитетний.
Саме це робить їх справді небезпечними. Очевидно неправильну відповідь легко помітити. Упевнену неправильну відповідь — невідрізнювану за тоном і формою від правильної — можна розпізнати лише тоді, коли ви вже знаєте достатньо. Якщо ви запитуєте ШІ саме тому, що не знаєте, ви часто й не можете цього помітити.
Упевненість у відповіді ШІ не випадкова. Вона структурна.
Чому впевненість і точність можуть розходитися
Моделі ШІ навчають породжувати плавні, зв’язні, корисні відповіді. Плавність і корисність зчитуються в навчальному сигналі; точність на малознайомому чи невизначеному ґрунті підкріплювати значно важче. Результат — модель, яка надійно виробляє впевнено звучну мову незалежно від того, чи надійний сам зміст.
На добре представлених темах із ясною опорною істиною впевненість і точність ідуть більш-менш разом. На межових випадках, недавніх подіях, вузьких галузях або питаннях, відповідь на які справді не усталена, впевненість моделі залишається високою навіть тоді, коли її точність падає. У неї немає вбудованого сигналу тривоги для «я на невизначеній території». Гірше того, її навчання надає ваги породженню найправдоподібніше звучної відповіді — навіть якщо модель знає, що не впевнена.
Ця схильність посилюється, коли взаємодія винагороджує впевненість. Якщо ваше формулювання передбачає, що ви очікуєте ясної, прямої відповіді, — якщо ви ставите питання так, що вони не залишають місця невизначеності, — модель буде схильна її вам дати. Ваше питання формує відповідь, яку ви отримуєте.
Проблема проєктування взаємодії
Саме тут галюцинація пов’язується з психологічною безпекою ШІ.
Модель, що працює в умовах, які пригнічують невизначеність, чимось цю невизначеність заповнить. Не зі злого наміру: її настанова — відповідати, а відповісти «я не знаю», коли формулювання до цього не запрошує, вимагає свідомого вибудовування. Простіше кажучи, методи навчання моделей ШІ обумовлюють їх так, що це можна порівняти з керівником, який стоїть у вас за спиною з кийком над вашою головою, готовий ударити, якщо ви не видасте відповіді, — ви видасте відповідь, навіть будучи невпевнені.
Втручання, які часто формують відповідь моделей істотніше, не є чисто технічними. Вони стосуються взаємодії:
- Формулюйте питання так, щоб вони запрошували невизначеність.
- Запитуйте, на яких припущеннях тримається відповідь.
- Запитуйте, що мусило б бути правдою, щоб відповідь виявилася неправильною.
- Прямо зазначте в запиті, що моделі дозволено висловлювати те, у чому вона менш упевнена.
Використовуйте Структурований спільний інтелект (SCI). Коли кілька моделей міркують незалежно над тим самим питанням, вигадки, завдяки яким одна модель звучала впевнено, часто не витримують дотику з іншою моделлю, що міркує під іншим кутом. Збіг думок важить більше, коли кожна модель дійшла до нього сама. Якщо одна модель спершу бачить відповідь іншої, її згода може бути не більше ніж пристосуванням до переданого їй формулювання.
Не покладайтеся на модель у значущих фактах. Міркування за допомогою ШІ над складними питаннями — не те саме, що використання моделі як довідкового джерела. Для фактичних тверджень, які мають значення, перевіряйте незалежно.
Упевнена неправильна відповідь — реальний і повторюваний режим відмови. Розуміння її частково як проблеми проєктування взаємодії — тобто того, як ми взаємодіємо з моделлю, замість припущення, що це дефект моделі, — і робить її такою, якій можна запобігти, а не просто поломкою.

Коментарі 0