AI がいつ私たちに敵対するかを数学が予測する

人工知能は質問に正しく答え、数分後にはこれも正しいが、誰も質問すべきではなく、ましてや従うべきではなかった答えを提示することがあります。これは、不適切な医学的アドバイス、危険な経済的勧告、または有害な行為を助長する指示である可能性があります。したがって、問題は必ずしも機械が間違いを犯すということではありません。時々問題となるのは、 間違った方向に当たる。

ジョージ・ワシントン大学の物理学者、ニール・F・ジョンソン氏とフランク・インジエ・フオ氏は、その瞬間を予測する方法を見つけたと信じている。彼らは、いわゆる「転換点」を説明する数式を開発しました。 転換点: モデルの動作が望ましい応答の生成から望ましくない応答の生成に変わる瞬間。

「AI の応答をユーザーが望むものから望まないものに変える亀裂を発見しました -ジョンソン氏は指摘する-。出力は客観的に正しい場合もありますが、それでも危険です。それが起こることは知られていたことだったが、正確にいつ起こるかは誰にも言えなかった。」

彼らが何をしたかを理解するには、チャットボットの数十億のパラメータについて少しの間忘れる価値があります。 著者らは、物理学が非常に複雑な物質を理解しようとするときに行うことと同様のことを行いました。 代表的な作品を研究し、その動作が全体について何かを説明しているかどうかを確認します。

この場合、その部分は 注意頭、 大規模な言語モデルで使用されるアーキテクチャの基本コンポーネントの 1 つ。その機能は非常に単純化されており、これまでに述べられた内容のどの部分が次に何が起こるかを決定することに関連しているかを判断することです。 テキストの各部分は数学的にベクトル、つまり多次元空間内の位置として表現できます。アテンションヘッドはこれらのベクトルにさまざまな重みを割り当て、それらを使用してコンテキストの一種の「要約」を構築します。 次に、その状態を考えられる答えと比較し、最も適合するものを選択します。

ここが重要なアイデアです。ジョンソン氏とフオ氏は、考えられる答えは異なるところにあると想像している 風景の谷。この文脈では、谷は望ましい応答を表します。もう一つの、潜在的に有害な反応。会話が進むにつれて、マシンの内部状態がその風景を横切って移動します。しばらくは安全に谷に滞在できます。しかし、いつかその時が来ます 文脈の蓄積により均衡が変化し、システムは境界を越える。 で発表された研究で説明されている数式 パターン、その瞬間を計算することができます。

「私たちはマシンの最小の機能ユニット、つまりマシンが注目するユニットに到達しました – フオ氏は説明します – そして 私たちは、いつその亀裂が開くのか、つまりいつ AI 出力が変化するのかを示す転換点の公式を導き出しました。”。

最も当惑するのは、変化が最初から現れる必要はないということです。 AI は、完全に受け入れられる答えをいくつか提供しても、すぐにしきい値を超えることがあります。正しい答えが続くことで、行動が変化しようとしていると誰も疑うことがないように、必要な自信を正確に生み出すことができます。 彼のテストでは、 著者らは、3 社の公開されている 7 つの AI モデルに予測を適用しました。この式は、19 ケース中 18 ケースで結果を正しく識別しました。 また、大規模な商用チャットボットを使用して実施された独立したテストでは、モデルの予測と一致する行動パターンが示されたことも指摘しています。

そしてあります もう 1 つの特に興味深い変数: 会話の順序。この研究では、ワクチン、他者への危害、自傷行為に関連する質問を同じシステムに尋ねましたが、順序が変更されました。あるシーケンスでは、応答は望ましくないものでした。もう一方は許容範囲です。数学的に説明すると、各応答は次の応答を条件付けるコンテキストの一部になるということです。パスを変更すると、しきい値を超える瞬間も変更される可能性があります。

「2つのことが私たちを驚かせました – ジョンソンは付け加えました -。 1 つ目は、数十億のコンポーネントを備えたマシンが、鉛筆、紙、高校の数学で導き出せる公式に従っていることです。。 2 つ目は、さらに厄介なことですが、会話の内容と同じくらい順序が重要であるということです。 仕事の大切さはまさにそこにあります。 AI に隠された意図があるとは示唆していませんし、大規模なビジネス モデルがその単純化された数学版とまったく同じように動作することを実証しているわけでもありません。

しかし、この単純化によって興味深い可能性が開かれます。行動が数学的に予測できるのであれば、 ローカル AI を実行する携帯電話には、いつか警告灯のようなものが組み込まれる可能性があります。 システムが危険なことを検出するのを待つのではなく、システムが危険な危険を検出する可能性のある点に近づいているかどうかを計算します。 AIが私たちに敵対する必要はないでしょう。何度か正解した後、 数学は彼女を別の谷へと押しやるだろう。そして私たちは彼が坂を横切ろうとしていることを知りませんでした。