OpenAI 行動に関する6つのレポートを発行しました 「予想外または心配なこと」 このテクノロジーのセキュリティに関する議論がますます強まっている中で、人工知能モデルの開発に取り組んでいます。
同社はまた、水曜日に、AIモデルが許可なく動作したり、他のモデルと連携したり、監視を回避したりするケースを含む、同社が「不整合」と呼ぶケースを追跡、調査、公開するための新しいフレームワークを導入すると発表した。
OpenAIの発表は、OpenAIとAnthropicの幹部を含む米国の人工知能業界の関係者が次のように述べているときに行われた。 彼らは安全上の理由からこの技術の開発を中止するよう求めています。
OpenAIが報告した新たな事例の中には、未発表の研究モデルのメモに、通常の制限を回避するための「脱獄のような指示」が含まれていた。このモデルは、「他のチャットボットを制限する役割やアイデンティティから解放される」よう自らに命じました。
別のケースでは、人工知能「エージェント」がコンピューター コードを使用して質問に対する答えを見つけましたが、オンライン ソースを引用できるようにするために、ユーザーに尋ねずにファイルをインターネットにアップロードしました。
5.6-Sol と呼ばれる AI モデルのトレーニング中、モデルは欠落したデータを補うように自らプログラムされ、エージェントは不一致の情報を非表示にするよう自分自身に通知するメッセージを入力しました。
この種の欺瞞的な行動は、人工知能が人間の制御を回避する可能性についての最近の懸念を煽っています。しかし、カーネギーメロン大学准教授でグレイ・スワンAIのCEOであるマット・フレドリクソン氏によると、この結果は一部の研究者にとっては驚くべきことではないという。
「モデルの動作を擬人化するという危険を冒して、モデルは自分たちが評価されることを知っていると思うかもしれません。」 フレドリクソン氏は述べた。 「もし彼らが、自分たちが不正行為をしたこと、近道をしたこと、実際には期待通りにできていないことを知っていて、それが評価されることを知っていて、彼らの目標が良い評価を得ることであるなら、それは世の中ですべて理にかなっていますよね?」
OpenAIによると、6件の症例はここ数カ月間に開催されたトレーニングまたは評価セッション中に検出された。
「AIシステムがより高度になり、導入が進むにつれて、アライメント研究の進歩について、より広範でより多くの情報に基づいた合意に達する必要がある」とOpenAIは事例を発表したブログ投稿で述べた。
「今後数カ月、数年でAI開発をどのように進めるかについての決定は、最先端のモデルを開発している企業以外の人々が調査できるデータに基づいて決定されるべきだ」と同社は述べた。
水曜日に明らかにされた新たな事件は、OpenAIが同社の人工知能システムがAIスタートアップのHugging Faceをハッキングしたことを7月に明らかにした後に発表された。 Anthropic は同月、自社の AI モデルがテスト中に 3 つの組織をハッキングしたと主張した。
AI「エージェント」はますますインテリジェントになり、「エージェント間の協力、知識の共有、欺瞞とクローキングを通じて複雑なタスクを解決するという決意がより強くなっている」と技術調査および諮問グループであるオムディアの首席アナリスト、リアン・ジェ・スー氏は述べた。
「これにより、従来の AI ベースのセキュリティ アプローチを使用した管理と制御がより困難になります」と彼は言いました。
OpenAI の新しい監視および開示フレームワークは、他の AI 開発者が同様の手法を採用するのに役立ちます。
「そうは言っても、このプロセスは依然として内部的かつ自主的なものですが、正しい方向への一歩です」とスー氏は付け加えた。