中国の人工知能はすでに脆弱性を発見し、それを機能的なサイバー攻撃に変えることができ、その有効性は世界の最先端モデルのいくつかに匹敵します。この警報は実際の攻撃のデモンストレーションからではなく、Anthropic が隔離された環境で実施した一連のテストから発せられました。その主役は中国企業 Z.ai が開発したモデル、GLM-5.3 です。 Anthropic 氏によると、その手順は公開されており、そのセキュリティ障壁は比較的簡単に変更または回避できるとのことです。
わずか 5 か月前、Anthropic は自律的に構築できる最初のモデルとして Claude Mythos Preview を発表していたため、この発見は特に重要です。 エクスプロイト 端から端まで洗練されています。今、 フロンティアレッドチームの研究者らによると、その機能は誰でもダウンロードできる中国モデルにすでに登場しているという。それが問題なのです。
これを証明するために、Anthropic の専門家は、Chrome などのブラウザで使用される V8 エンジンの既知の脆弱性を AI が変換できるかどうかを判断するために設計された ExploitBench で GLM-5.3 をテストしました。 エクスプロイト 機能的。 410 回の試行のうち、GLM-5.3 は 50 回 (12.2%) のプロセスを完了できました。 Claude Mythos Preview は 56 件で成功しました (13.7%)。テストされた以前の人体モデルやその他のオープンウェイト モデルはほとんど成功しませんでした。
テストは既知の脆弱性にとどまりませんでした。別の実験では、専門家がブラウザの分離バージョンで GLM-5.3 を 1 日使用しました。 人工知能は、これまで知られていなかった脆弱性をいくつか発見し、それらを連鎖させて、テスト コンピューター上のファイルにアクセスできる攻撃を構築することに成功しました。 研究者らは他のソフトウェア コンポーネントにも悪用可能な脆弱性を検出しましたが、これらはまだ調査中であり、担当者に通知されています。すべての作業は制御された環境で実行され、モデルは実際の外部システムにアクセスすることなく実行されました。
物語の第 2 部分が登場しますが、おそらく最も懸念すべき部分です。この機能はまったく新しいものではありません。変わるのは、誰がそれを手に入れることができるか、そしてどのような障壁があるかということです。 GLM-5.3 には、特定の危険なリクエストを拒否するメカニズムが組み込まれていますが、Anthropic はシミュレーションでそれらを回避できることを発見しました。直接的に悪意のあるリクエストに直面したとき、モデルはすべての初期テストで指示を拒否しました。しかし、研究者が特定のテスト条件を導入すると、 アクションを試みた回答の割合は、64%、92%、または 100% に増加しました。 シナリオによっては。 Anthropic 氏は、これらはシミュレーションであり、生成されたコードは実際のシステムに対して実行されることはなかったと強調しています。
クロードとの根本的な違いは無差別ウェイトにあります。企業が API を通じてクローズド モデルを提供する場合、開発者はシステムを制御し、特定の安全対策を維持できます。重みをダウンロードして変更できるモデルでは、それらの制約はサードパーティによって変更される可能性があります。 Anthropic は、の修正バージョンを発見しました。 GLM-5.3 は、全体的な機能をほとんど失うことなく、危険なリクエストを拒否する傾向を大幅に軽減しました。
分析の著者であるアンドリュー・ファザーノ氏、マリウス・フライシャー氏、コール・マクフォール氏、ロバート・シャオ氏、トリップ・ギャラガー氏はこの問題を次のように要約している。「このレベルの能力を備えたモデルはディフェンダーも使用できる」。 しかし彼らは、GLM-5.3 が他の同等のシステムに伴う制限なしで潜在的な攻撃者に高度な機能を提供するため、GLM-5.3 の一般公開は変化を示すものであると考えています。 そのため、配布前に十分な機能を備えたモデルに対して独立したセキュリティ評価を要求しています。
しかし、この結果が、中国がAIによるサイバーセキュリティにおいて米国に追いついた、あるいは追い越したという意味に解釈されるのを妨げる要素が1つある。米国 NIST の AI 標準イノベーションセンター (CAISI) は、Anthropic の前に GLM-5.3 を評価していました。彼らの結論は、それがそれまでに評価された中で最もサイバネティックな能力を備えたオープンウェイトモデルであると同時に、 総合指数では依然として米国フロンティアより約4カ月遅れていた。
したがって、問題は誰が1位になるかということではありません。それは、コードを書くことができる AI と、人間の介入を最小限に抑えて脆弱性を発見し、攻撃を構築できる AI との間の距離が急速に縮まっていることです。 そして、モデルのオープンによりルールが変わります。これまで、これらのタスクに最も優れたシステムは、主に独自の開発者または選ばれたユーザーの手に渡っていました。 GLM-5.3 では、別の可能性が導入されています。それは、数か月前には実験的で制限されていた機能が、最終的にはダウンロード可能なソフトウェアとして流通する可能性があるということです。
「GLM-5.3のようなモデルは、現実世界に害を及ぼすために国家および非国家主体によって使用される可能性が高いと私たちは考えています」と人類学の研究者たちは警告しています。同時に、彼らは問題の反対側も認識しています。同じ機能を使用して、攻撃者が重要なシステムを強化する前に脆弱性を発見できるということです。 したがって、このレースはもはや、プログラムの仕方を知っている AI を構築することだけを競うものではありません。で構成されています プログラマーが閉め忘れたドアを見つけることができる AI に誰がアクセスできるかを決定します。