AI 征服了棋盤遊戲「陸軍棋」?如何解讀隱藏資訊

在擺放著陸軍棋棋子的棋盤上,疊加著象徵 AI 思考過程的數位數據顆粒
AI Summary

Google DeepMind 的 AI「DeepNash」在棋盤遊戲「陸軍棋(Stratego)」中具備了人類專家級別的水準,實現了 AI 的新突破。

我們常見的 AI 新聞多是擊敗人類圍棋或西洋棋冠軍的消息。然而,這些遊戲有一個共通點,那就是棋盤上的所有棋子都是公開可見的。在輪到自己行動時,既然能掌握對手所有的棋牌,AI 只要運算夠快就能獲勝。

但請試著想像一下,如果你在玩卡牌遊戲時完全不知道對手手裡有什麼牌,或者在玩棋盤遊戲時不知道對方隱藏了什麼棋子,那會如何呢?在這種情況下,光靠運算是不夠的,還必須讀懂對手的心理,甚至運用「欺敵戰術」。最近,這塊困難的領域終於傳來 AI 超越人類界限的驚人消息。由 Google DeepMind 開發的 AI「DeepNash」征服了棋盤遊戲「陸軍棋(Stratego)」。

為何這則新聞很重要?

回想一下日常生活,我們在現實中做出的無數決策,都是在資訊不足的情況下進行的。沒有人能百分之百確定明天的股市會如何,或者今天走哪條路能避開交通堵塞。像這樣在資訊不完全的狀態下做出最佳選擇的能力,是 AI 為了更貼近人類領域所必須跨越的高牆。

過去的 AI 在西洋棋或圍棋等所有資訊透明公開的環境中雖能碾壓人類,但在像陸軍棋這樣需要隱藏資訊並運用欺敵手段的環境中,卻始終停留在業餘水準(出處:Gamehasbeen particularly challenging forAIto master, scientists say,出處:[2206.15378] MasteringtheGameofStrategowith Model-Free…)。然而 DeepNash 的出現,意味著 AI 開始能夠處理現實世界中複雜的「不確定性」,是一場重大事件。

簡單來說,這是什麼樣的遊戲?

陸軍棋是一款「非完美資訊遊戲(a game of imperfect information)」,你無法得知對方棋子的身分(出處:DeepMind’s newestAIthrashes human gamers atStratego)。

比喻來說,如果西洋棋是將所有牌攤開來的正面交鋒,陸軍棋就像是在不知道對手底牌的情況下,進行彼此的諜報戰。在直接攻擊對方棋子進行戰鬥之前,你無從得知那是炸彈還是強大的將軍。因此,你必須不斷懷疑對手是否在欺騙你,或者是否設下了陷阱(出處:ThisAIFinally Beat the Best Humans at One of the Last BoardGames…)。

為了征服這類遊戲,DeepNash 使用了名為「無模型深度強化學習(model-free deep reinforcement learning)」的方式([出處:AIbeats us at anothergame:STRATEGO DeepNash… - YouTube](https://www.youtube.com/watch?v=3vO45gcEbRs))。

簡單說,這個 AI 並不是死記硬背規則,而是透過反覆與自己對弈(self-play),親自體悟出什麼樣的走法能提升勝率。在 10^33 種驚人的起始配置可能性,以及 10^535 種廣闊的遊戲狀態可能性中,DeepNash 透過億萬次的對局,自行摸索出了讀取對手棋路並刺破其弱點的方法(出處:ThisAIFinally Beat the Best Humans at One of the Last BoardGames…,出處:MasteringtheGameofStrategowith Model-Free)。

目前進展如何?

DeepNash 已經展現出凌駕於專家級人類玩家之上的實力(出處:DeepMind’s LatestAITrounces Human Players attheGame‘Stratego’)。過去的 AI 若是憑藉高速運算制伏對手,那麼 DeepNash 的特點在於它展現了推論隱藏資訊,以及刺探對手弱點的心理判斷力,這兩者之間有著巨大的差異。

當然,這終究是在既定規則內的成果。雖然陸軍棋非常複雜,但現實世界中存在的例外與變數比遊戲多得多。即便如此,DeepNash 確實證明了 AI 系統已經抵達了新的開拓地(new frontier)(出處:DeepMind’s newestAIthrashes human gamers atStratego)。

未來有什麼值得期待的?

DeepNash 的成功將成為未來 AI 在現實生活中做出更靈活決策的重要基石。預計在需要於資訊不足的環境下進行決策的物流優化、企業間複雜的協商,或者變數更多的環境中,AI 的能力將大幅提升。身為 AI 記者,我觀察到 AI 正擺脫單純計算器的身分,演化為能像人類一樣「憑眼色」判斷情況並應對的程度。或許不久之後,我們就能迎來一個 AI 能與我們共同煩惱生活中複雜且不確定問題的時代。

參考資料

  1. Snap! - - Spooky Space, CuteAI,AIMastersStratego- Spiceworks…
  2. [Vue HN 2.0 Withmostinformationhidden,thegameStrategohad…](https://vue-hackernews-ssr-5cavbdjcta-ew.a.run.app/item/49933740)
  3. ThisAIFinally Beat the Best Humans at One of the Last BoardGames…
  4. DeepMind’s newestAIthrashes human gamers atStratego
  5. Gamehasbeen particularly challenging forAIto master, scientists say
  6. MasteringtheGameofStrategowith Model-Free
  7. [AIbeats us at anothergame:STRATEGO DeepNash… - YouTube](https://www.youtube.com/watch?v=3vO45gcEbRs)
  8. [2206.15378] MasteringtheGameofStrategowith Model-Free…
  9. stratego.io
  10. DeepMind’s LatestAITrounces Human Players attheGame‘Stratego’
  11. Withmostinformationhidden,thegameStrategohadstumped…
AD
測試你的理解
Q1. 為何棋盤遊戲「陸軍棋」對 AI 而言,比圍棋或西洋棋更難以學習?
  • 棋子數量太多
  • 這是一款無法得知對方棋子身分的『非完美資訊』遊戲
  • 時間限制太短
陸軍棋是一款無法得知對方棋子身分的「非完美資訊」遊戲,因此對於無法直接觀察資訊的 AI 來說,比西洋棋或圍棋更難學習。
Q2. AI「DeepNash」為了征服陸軍棋,使用了哪種主要的學習方式?
  • 學習大量人類棋譜
  • 與自己對弈進行學習的無模型強化學習(Model-Free Reinforcement Learning)
  • 輸入專家建議的方式
DeepNash 在沒有額外搜尋演算法的情況下,透過與自己對弈來學習的「無模型強化學習」方式精通了陸軍棋。
Q3. 陸軍棋的遊戲環境具有多大的複雜性?
  • 約 100 種可能性
  • 高達 10^535 種遊戲狀態可能性
  • 比西洋棋少得多的可能性
陸軍棋擁有高達 10^535 種天文數字般的遊戲狀態可能性,因此被歸類為極其複雜的策略遊戲。