トランプのババ抜きでは、相手の顔色をうかがいながら、見えないカードの並びを頭の中で想像して1枚を引きます。
チェスや囲碁では人間の頂点を、ポーカーではプロを打ち負かしてきたAIですが、長いあいだ攻略できなかったボードゲームがあります。
それが、相手の駒の正体が分からないまま戦う戦略ゲーム「ストラテゴ」です。
マサチューセッツ工科大学(MIT)やカーネギーメロン大学などの研究チームは、このゲームのためのAI「アタラクソス」を開発し、史上最強とも言われる人間のプレイヤーに挑ませました。
見えない駒の読み合いで、AIは人間の頂点に勝てたのでしょうか。
研究内容の詳細は2026年9月30日に『Nature』にて発表されました。
目次
- AIを寄せつけなかった「ストラテゴ」とはどんなゲーム?
- 見えない駒をどう読む? アタラクソスが勝負に持ち込んだ2つの工夫
- 勝ち方は「冷静」そのもの、学習費用は桁違いに安かった
AIを寄せつけなかった「ストラテゴ」とはどんなゲーム?

1997年にはチェスAIのディープ・ブルーがガルリ・カスパロフ氏を破り、2016年には囲碁AIのAlphaGoがイ・セドル氏に勝ちました。
ところがストラテゴでは、潤沢な予算を持つDeepMindでさえ、トップの人間に安定して勝てるAIを作れませんでした。
ストラテゴでは2人のプレイヤーが、元帥からスパイまでの階級を表す駒に爆弾と旗を加えた40個の駒を自陣に並べ、相手の旗を奪い合います。
相手の駒がどこにあるかは分かっても、それが何の駒かは分かりません。
駒の正体は2つの駒がぶつかった時に初めて明かされ、弱い方が盤上から取り除かれます。
情報が隠れているのはポーカーも同じですが、テキサス・ホールデム(ポーカーの代表的なルール)で隠れている手札は2枚だけで、ありうる組み合わせは1326通りしかありません。
一方のストラテゴでは、駒の並べ方だけで10の66乗通りを超えます。
さらにチェスがふつう40手ほどで終わるのに対し、ストラテゴは2000手に及ぶこともよくあります。
そして厄介なのが、弱い駒を元帥のように動かして相手をひるませる「ハッタリ」です。
ハッタリが多すぎれば脅しは効かなくなり、まったくしなければ手の内を読まれてしまいます。
筆頭著者のサミュエル・ソコタ氏も「ハッタリは使うほど相手に予想され、1回の価値が下がります」と話します。
研究チームによると、2022年に登場したDeepMindの「DeepNash」も、この駆け引きの加減でつまずいていました。
見えない駒をどう読む? アタラクソスが勝負に持ち込んだ2つの工夫

アタラクソスの土台は、自分自身との対戦を繰り返して強くなる「自己対戦」による強化学習です。
勝ちにつながった手はより多く、負けにつながった手はより少なく指すように学ぶという発想は、DeepNashと同じでした。
アタラクソスが自分自身と戦った対局は、合計1億6300万局にのぼります。
違ったのは、1局ごとに戦略をどれだけ変えるかの加減です。
隠れた情報があると、自己対戦の学習は同じところをぐるぐる回りやすくなります。
そこで研究チームは、学習の序盤では戦略を大胆に変え、後半では小さく慎重に変えるようにしました。
さらに大きな工夫が、DeepNashには無かった「一手ごとに先を読む」仕組みです。
AlphaGoのようなAIは指す直前に先読みをして戦略を磨きますが、ストラテゴでは考えるべき可能性が多すぎて、DeepMindはこれを実現できませんでした。
研究チームが用意したのは、相手の駒がこれまでどう動いてきたかからその正体を推測する「信念モデル」というニューラルネットワーク(脳の神経回路をまねた計算の仕組み)です。
アタラクソスはありうる配置をすべて調べる代わりに、もっともらしい配置をいくつか抜き出し、それぞれで候補の手を試しに進めて、結果の良い手を選びます。
見えない駒を全部数え上げるのではなく、「ありそうな駒」に絞って読むわけです。
論文によると、ストラテゴほど隠れた情報が多いゲームで指す直前に先読みするのは大きな難題とされ、これまでの研究は事実上それをあきらめていました。
こうして鍛えたアタラクソスが挑んだ相手は、ピム・ニーマイヤー氏です。
ニーマイヤー氏は世界選手権を4度制し、世界ランキング1位の座に600週以上ついてきた、史上最高とも言われるプレイヤーです。
ニーマイヤー氏は3週間にわたってオンラインで20局を戦い、1勝するごとに100ドルを受け取る条件でした。
AIが自分に合わせて戦い方を変えないと分かっていたので、弱点を探す時間は十分にありました。
それでも結果は、アタラクソスの15勝1敗4分けでした。
研究チームの知る限り、これはストラテゴの歴史で初めて、AIが人間を超える強さを示した結果です。
以前ナゾロジーではこういう記事も紹介しています(AIがチェスで圧勝する理由の一端が見えてきた――「ややこしいまま耐える」時間が人間より長い)
唯一の1敗について研究チームは欠点ではないとし、駒の並べ方をランダムにする必要があるこのゲームでは運が必ず絡むと説明しています。
論文のシニア著者でMITのガブリエーレ・ファリーナ助教は「完璧な戦略でも、ときには負けるのです」と話しています。
2025年のストラテゴ世界選手権でも、会場でアタラクソスに挑んだ参加者たちは40局中38局で敗れました。
勝ち方は「冷静」そのもの、学習費用は桁違いに安かった

アタラクソスという名前は、古代ギリシャ語で心が穏やかな状態を表す言葉に由来します。
ファリーナ氏は、AIならではの仕組みと、人間のような感情を持たないことのおかげで、アタラクソスは人間なら取り乱すような場面でも衝動的に動かないと考えています。
大きく負けている時、人間は一発逆転の賭けに出ることがありますが、アタラクソスはゆっくりと着実に形勢を立て直していきます。
また、相手が自分の弱点を疑う理由が無いと見積もった時には、その弱点にあえて手を付けません。
盤の両側が見える人には大惨事の一歩手前に見える場面でも、そのまま放っておくのです。
ファリーナ氏は「秘密を知っていながら、それを知らないかのように判断するのは人間にはとても難しいが、機械には簡単だ」と語っています。
そのため機械は、人間ならハッタリの時にしか指さないような手を指し、その後の手も人間よりずっとうまくつなげると研究チームは述べています。
ニューヨーク大学のユージン・ヴィニツキー助教は「勝つ確率が2%ほどの状況から、ボットがとても気軽な様子でハッタリを重ねて巻き返すのを見ていました」と振り返ります。
ファリーナ氏によると、アタラクソスは人間の戦い方の流行にも少し影響を与えたようです。
たとえば、旗を盤の隅に置いて爆弾2個だけで守るという、めったに使われない配置をアタラクソスが頻繁に使うことに、プレイヤーたちは驚いたそうです。
そして、もう一つ際立つのが学習にかかったコストです。
DeepNashはグーグルの専用チップ1024個で2〜3カ月かけて学習しており、研究チームはその費用を2025年の価格で300万〜450万ドルと見積もっています。
これに対してアタラクソスは、16個のGPU(画像処理用の半導体で、AIの計算にも広く使われる)と数千ドルほどの費用で学習を済ませました。
研究チームは同じ手法で「バラージ・ストラテゴ」でも人間を超えるAIを作り、カードゲームの「ハナビ」と「闘地主」でも最先端のAIを作り上げています。
対戦型・協力型・チーム型と性質の違うゲームで成功したことから、研究チームは、隠れた情報が多い状況で使える強化学習と探索(先を読んで手を選ぶ仕組み)の設計の型を確立したとしています。
ただし論文が実用的なAIに手が届くとしているのは、速く正確なシミュレーターを作れる問題に限って、とのこと。
MITは、将来この技術を応用すれば、ビジネスの交渉やサイバーセキュリティ、軍事作戦のように相手の手の内が見えない場面で、人間の判断を助けられる可能性があるとしています。
相手の手の内が見えない霧の中でも、AIは落ち着いて歩く方法を身につけつつあるのかもしれません。
参考文献
With most information hidden, the game Stratego had stumped AI—until now (Ars Technica)
https://arstechnica.com/science/2026/10/ai-finally-beat-the-best-stratego-player-in-history-and-did-it-on-a-budget/
MIT News (MIT News)
https://news.mit.edu/2026/game-playing-ai-stratego-new-champ-0930
元論文
Scalable decision-making for games of imperfect information
https://doi.org/10.1038/s41586-026-11036-y
ライター
天道銀河: 科学、歴史、心理、宇宙、生き物、テクノロジーなど、気になるものにはジャンルを問わず首を突っ込む雑食系ライターです。ひとつの分野を深く極めるというより、さまざまな知識を広く集め、意外なつながりを見つけるのが好きです。専門家ほど深くはなくても、好奇心の広さなら負けません。「こんな世界もあるのか」と思えるような、面白くてわかりやすい話題を届けていきます。
編集者
ナゾロジー 編集部
