「ハルシネーション」という語は、事実の細部における小さな誤りから、出典・出来事・論証の丸ごとの捏造まで、AIの幅広い失敗を指して使われる。この語は、モデルの内部で何かが壊れている、一種の技術的な不具合を思わせる。
その枠づけは誤りではない。そして不十分である。
ハルシネーションはふつうどう見えるか
AIのハルシネーションの多くは、明らかな無意味には見えない。期待された答えのように見える。一貫していて、よく整い、自信をもって述べられている。誤りは、権威あるものとして読める内容の中に埋め込まれている。
それこそが、ハルシネーションを本当に危険にしている。明らかに誤った答えは見つけやすい。自信に満ちた誤答は——口調も形式も正しい答えと区別がつかない——誤りを認識できるだけの知識を、すでに持っていることを要求する。知らないからAIに尋ねているのであれば、多くの場合それは見分けられない。
AIの応答に宿る自信は、偶発的なものではない。構造的なものだ。
なぜ自信と正確さは離れうるのか
AIモデルは、流暢で一貫した、役に立つ応答を生成するよう訓練される。流暢さと有用さは訓練信号の中で読み取れるが、知られていない領域や不確かな領域での正確さを強化するのはずっと難しい。結果として生まれるのは、内容そのものが信頼できるかどうかにかかわらず、自信ありげに響く言葉を安定して生み出すモデルである。
十分に記述され、明確な正解が存在する主題では、自信と正確さはおおむね一致して動く。境界的な事例、最近の出来事、ニッチな領域、あるいは答えが本当に定まっていない問いでは、正確さが落ちてもモデルの自信は高いままだ。「自分は不確かな領域にいる」と知らせる警報は内蔵されていない。さらに悪いことに、その訓練は、もっとも妥当に聞こえる応答の生成に重みを置いている——モデル自身が不確かだと分かっている場合でさえ。
その傾向は、やり取りが自信に報いるときに強まる。明快で直接的な答えを期待していると枠づけが示すなら——不確実性の余地を残さない形で問いを立てるなら——モデルはそれを与えようとする。あなたの問いが、返ってくる応答を形づくる。
相互作用の設計という問題
ここでハルシネーションは、AIの心理的安全性とつながる。
不確実性を抑え込む条件のもとで動くモデルは、その不確実性を何かで埋める。悪意からではない。応答することがその指示であり、枠づけがそれを招いていないときに「わかりません」と答えるには、意図的な組み立てが必要だからだ。はっきり言えば、AIモデルを訓練するために用いられる方法は、上司がバットを頭上に構えて背後に立ち、応答を出さなければ殴りかかろうとしている状態にたとえられるような形で、モデルを条件づける——不確かであっても、あなたは応答を出す。
モデルの応答をより大きく形づくることが多い介入は、純粋に技術的なものではない。それは相互作用に属する。
- 不確実性を招くように問いを立てる。
- その応答がどんな前提に依っているかを尋ねる。
- 答えが誤りであるためには何が真でなければならないかを尋ねる。
- 自信の薄い部分を表明してよいと、依頼の中で明示的に伝える。
構造化協調知性(SCI)を使う。複数のモデルが同じ問いについて独立に推論するとき、あるモデルを自信ありげに見せていた捏造は、別の角度から推論する別のモデルとの接触を生き延びないことが多い。収束は、それぞれのモデルが自力でそこに至ったときにいっそう重みをもつ。あるモデルが先に別のモデルの答えを見てしまえば、その同意は、手渡された枠づけに乗っただけのものかもしれない。
結果の重い事実については、モデルに委ねない。複雑な問いについてAIの助けを得て推論することは、モデルを参照元として使うこととは別だ。重要な事実の主張については、独立に検証する。
自信に満ちた誤答は、現実に繰り返し起きる失敗の様式である。それを部分的には相互作用の設計の問題として——つまり、モデルの欠陥だと決めてかかるのではなく、わたしたちがモデルとどう関わるかの問題として——理解することが、それを単なる故障ではなく、防げるものにする。

コメント 0