Google DeepMindのAI「DeepNash」が、ボードゲーム「ストラテゴ」で人間専門家レベルの実力を備え、AIの新たな限界を突破しました。
私たちがよく目にするAIニュースでは、AIが囲碁やチェスで人間のチャンピオンを打ち負かしたという話題が多くありました。しかし、これらのゲームには一つの共通点があります。それは、盤上のすべての石や駒が見えているという点です。自分の番に相手が持っている手札がすべて分かるのであれば、AIは計算さえ上手くこなせば勝利できました。
ですが、想像してみてください。もしカードゲームをしていて、相手がどんなカードを持っているか全く分からなかったらどうでしょう? あるいは、ボードゲームで相手がどの駒を隠しているか分からないままプレイしなければならないとしたら? このような状況では、計算を上手くやるだけでなく、相手の心理を読み、「駆け引き」までする必要があります。この困難な領域において、AIがついに人間の壁を越えたという驚くべき知らせが届きました。Google DeepMindが開発したAI「DeepNash」が、ボードゲーム「ストラテゴ(Stratego)」を征服したのです。
なぜこのニュースが重要なのか?
日常生活を振り返ってみましょう。私たちが現実で直面する多くの決断は、情報が不足した状態で行われます。明日の株式市場がどうなるか、今日どの道を通れば交通渋滞を避けられるか、100%確信できる人はいません。このように不完全な情報の中で最善の選択を下す能力は、AIが人間の領域に一歩近づくために必ず乗り越えなければならない壁でした。
従来のAIはチェスや囲碁のようにすべての情報が透明に公開された環境では人間を圧倒しましたが、ストラテゴのように情報を隠し、駆け引きが必要な環境ではアマチュアレベルから脱することができませんでした(出典: Gamehasbeen particularly challenging forAIto master, scientists say、出典: [2206.15378] MasteringtheGameofStrategowith Model-Free…)。しかし、DeepNashの登場は、AIが現実世界の複雑な「不確実性」を扱い始めたことを意味する大きな出来事です。
どんなゲームなのか?
ストラテゴは、相手の駒の正体が分からない「不完全情報ゲーム(a game of imperfect information)」です(出典: DeepMind’s newestAIthrashes human gamers atStratego)。
例えるならこうです。チェスがすべてのカードを広げた状態での正面対決なら、ストラテゴは相手の手札が何であるか分からない状態で互いに諜報戦を繰り広げるようなものです。敵の駒を直接攻撃して戦闘を行うまで、その駒が爆弾なのか、強力な将軍なのかは分かりません。そのため、相手が自分を騙そうとしているのか、あるいは罠を仕掛けているのかを絶えず疑わなければなりません(出典: ThisAIFinally Beat the Best Humans at One of the Last BoardGames…)。
| このゲームを征服するために、DeepNashは「モデルフリー強化学習(model-free deep reinforcement learning)」という手法を用いました([出典: AIbeats us at anothergame:STRATEGO | DeepNash… - YouTube](https://www.youtube.com/watch?v=3vO45gcEbRs))。 |
簡単に言えば、このAIは膨大なルールを暗記したのではなく、自分自身と対局(self-play)を繰り返しながら、どの手が勝率を高めるのかを体得したのです。10の33乗という膨大な初期配置の組み合わせと、10の535乗という広大なゲーム状態の可能性の中で、DeepNashは数億回のゲームを通じて相手の手を読み、隙を突く方法を自ら習得したわけです(出典: ThisAIFinally Beat the Best Humans at One of the Last BoardGames…、出典: MasteringtheGameofStrategowith Model-Free)。
どこまで到達したのか?
DeepNashはすでに専門家レベルの人間のゲーマーを相手に、圧倒的な実力を見せつけました(出典: DeepMind’s LatestAITrounces Human Players attheGame‘Stratego’)。かつてのAIが単なる計算速度で相手を制圧したのに対し、今回のDeepNashは隠された情報を推論し、相手の裏をかく心理的な判断力まで示したという点で大きな違いがあります。
ただし、これはあくまで定められたルール内での成果です。ストラテゴは非常に複雑ですが、私たちが住む現実世界はゲームよりもはるかに多くの例外と変数が存在するためです。それでもDeepNashは、AIシステムが「新しい開拓地(new frontier)」に到達したことを確実に証明しました(出典: DeepMind’s newestAIthrashes human gamers atStratego)。
次は何が待っているのか?
DeepNashの成功は、今後AIが実生活においてより柔軟な意思決定を下せるようになるための重要な基盤となるでしょう。情報が不足した環境で決断を下さなければならない物流の最適化、企業間の複雑な交渉、あるいはより変数の多い環境において、AIの能力が大幅に向上することが期待されます。AI記者の視点から見ると、今やAIは単なる計算機から脱却し、人間のように「空気を読んで」状況を判断し、対応するレベルへと進化しています。近い将来、私たちが日常で直面する複雑で不確実な問題についても、AIが共に悩み考えてくれる時代が来るかもしれません。
参考資料
- Snap! - - Spooky Space, CuteAI,AIMastersStratego- Spiceworks…
-
[Vue HN 2.0 Withmostinformationhidden,thegameStrategohad…](https://vue-hackernews-ssr-5cavbdjcta-ew.a.run.app/item/49933740) - ThisAIFinally Beat the Best Humans at One of the Last BoardGames…
- DeepMind’s newestAIthrashes human gamers atStratego
- Gamehasbeen particularly challenging forAIto master, scientists say
- MasteringtheGameofStrategowith Model-Free
-
[AIbeats us at anothergame:STRATEGO DeepNash… - YouTube](https://www.youtube.com/watch?v=3vO45gcEbRs) - [2206.15378] MasteringtheGameofStrategowith Model-Free…
- stratego.io
- DeepMind’s LatestAITrounces Human Players attheGame‘Stratego’
- Withmostinformationhidden,thegameStrategohadstumped…
- 駒の数が多すぎるから
- 相手の駒の正体が分からない不完全情報ゲームだから
- 制限時間が短すぎるから
- 人間による膨大な棋譜の学習
- 自身と対局を繰り返すモデルフリー強化学習
- 専門家からの助言を入力する方式
- 約100通りの場合
- 10の535乗に達するゲーム状態の可能性
- チェスよりもはるかに少ない場合