研究者らはクロード、ChatGPT、キミ、ジェミニにシヴィライゼーション VI をプレイさせたところ、基本的なエラーにより 23 試合中 20 試合で負けました。

の研究者チーム オックスフォード大学 およびその他の機関を含む Googleディープマインド そして 英国 AI 安全性協会、4つの人工知能モデルをプレイさせました シヴィライゼーション VI 何時間も戦略を維持する必要があるタスクに彼らがどのように対処しているかを確認します。残高は 3 勝 20 敗。他の文明が勝とうとしていたかどうかを確認しなかったなど、人間プレイヤーとしては初歩的な失敗もあった。と呼ばれる研究 CivBench、2026 年 9 月 2 日に arXiv で公開されました。

使用した実験 クロード 作品4.6GPT-5.4ジェミニ 3.1 プロ そして キミ K2.5。各モデルは実験で他の AI と対峙することなく、ビデオ ゲーム自体によって制御されるライバルに対して文明を率いました。

シヴィライゼーション VI の選択の答え 試合中に必要とされる意思決定の多様性と量。この古典的なターンベースの戦略物語では、都市を開発したり、テクノロジーを研究したり、協定を交渉したり、戦争をしたりすることができます。すべての敵を征服する必要がなくても、科学、文化、宗教、外交などを通じて勝利することができます。

目的はチェックすることでした 多くの意思決定を連鎖させ、長期間にわたって計画を維持する必要がある複雑なタスクに AI がどのように取り組むか。モデルはゲーム戦略を説明できますが、研究者はそれを知りたかったのです それらを適用して、何が起こっているかに適応させることができた場合。ゲームは 300 ターンを超える場合があり、進行するにつれてさまざまな側面に同時に対処する必要があります。

研究者はAIを可能にするシステムを開発しました マウスの代わりにコマンドを使用してプレイします。モデルは都市と軍隊に関する情報を要求し、どのユニットを移動するか、どの建物を建設するかを示すことができます。システムはシヴィライゼーション VI でそれらの命令を実行し、 結果を書面で返しました。 AI モデルには、軍隊の位置とステータスの確認、ユニットの移動、都市の設立、研究するテクノロジーの選択など、特定のアクションを実行するための 76 の機能がありました。このシステムは次の場所で利用できます。 プロジェクトリポジトリ

研究者らはすべてのAIに同じ指示を与えた。その中には、20ターンごとに勝利に近づいているライバルがいるかどうかを確認することや、後で参照できるように次のステップを日記に記録することなどが含まれた。 リアム・ウィルキンソンこの研究の共著者は、最初のテストでは次のように説明しています。 ゲームには多くの情報が蓄積され、モデルは初期の詳細を利用できなくなりました。。 AI が計画を取得するために参照できるジャーナルを組み込んだのはそのためです。ただし、その助けは、 計画していたタスクを取り消すことを妨げなかった、科学施設の建設や別の都市の創設など。

それに関係する例の一つとして、 ウィルキンソン AIが軍事戦略を準備している様子を示している。 マケドニア110ターンの間、彼は軍事インフラを構築しなければならないことを繰り返し認めたが、開発に必要なキャンプを構築しなかった。。別のケースでは、AI は自分の科学的優位性を主張しながらも、 データはライバルに遅れを取っていることを示した

脅威の追跡 研究者の指示にも関わらず失敗した。参考にしたモデル プレイヤーが 30 ~ 75 ターンごとに勝つために必要な金額、ただし、20ごとにそれを行う必要がありました。情報は入っていましたが、 彼らはそれを知るためにそれを要求する必要があり、そうするまでに長い時間がかかりました。

この研究は次の問題を指摘しています 彼らはどのように注意を分散させたのか。彼らは当面の行動に重点を置き、全体の状況や自分たちが決めたことを十分に検討していませんでした。彼らは単一の原因を特定していませんし、より良い記憶力がそれを解決するのに十分であることを証明していません。

著者らは、 問題を解決する能力が向上した AI は、今後もこうした間違いを繰り返す可能性があります 必要な情報を調べなかったり、計画を保留したままにした場合。だからこそ彼らは試してみようと提案するのです 自動チェックと ToDo リストを常に最新の状態に保つそのため、AIは定期的にライバルをチェックし、まだ完了していないタスクを回復します。