Google DeepMind 的 AI「DeepNash」在棋盤遊戲「陸軍棋(Stratego)」中具備了人類專家級別的水準,實現了 AI 的新突破。
我們常見的 AI 新聞多是擊敗人類圍棋或西洋棋冠軍的消息。然而,這些遊戲有一個共通點,那就是棋盤上的所有棋子都是公開可見的。在輪到自己行動時,既然能掌握對手所有的棋牌,AI 只要運算夠快就能獲勝。
但請試著想像一下,如果你在玩卡牌遊戲時完全不知道對手手裡有什麼牌,或者在玩棋盤遊戲時不知道對方隱藏了什麼棋子,那會如何呢?在這種情況下,光靠運算是不夠的,還必須讀懂對手的心理,甚至運用「欺敵戰術」。最近,這塊困難的領域終於傳來 AI 超越人類界限的驚人消息。由 Google DeepMind 開發的 AI「DeepNash」征服了棋盤遊戲「陸軍棋(Stratego)」。
為何這則新聞很重要?
回想一下日常生活,我們在現實中做出的無數決策,都是在資訊不足的情況下進行的。沒有人能百分之百確定明天的股市會如何,或者今天走哪條路能避開交通堵塞。像這樣在資訊不完全的狀態下做出最佳選擇的能力,是 AI 為了更貼近人類領域所必須跨越的高牆。
過去的 AI 在西洋棋或圍棋等所有資訊透明公開的環境中雖能碾壓人類,但在像陸軍棋這樣需要隱藏資訊並運用欺敵手段的環境中,卻始終停留在業餘水準(出處:Gamehasbeen particularly challenging forAIto master, scientists say,出處:[2206.15378] MasteringtheGameofStrategowith Model-Free…)。然而 DeepNash 的出現,意味著 AI 開始能夠處理現實世界中複雜的「不確定性」,是一場重大事件。
簡單來說,這是什麼樣的遊戲?
陸軍棋是一款「非完美資訊遊戲(a game of imperfect information)」,你無法得知對方棋子的身分(出處:DeepMind’s newestAIthrashes human gamers atStratego)。
比喻來說,如果西洋棋是將所有牌攤開來的正面交鋒,陸軍棋就像是在不知道對手底牌的情況下,進行彼此的諜報戰。在直接攻擊對方棋子進行戰鬥之前,你無從得知那是炸彈還是強大的將軍。因此,你必須不斷懷疑對手是否在欺騙你,或者是否設下了陷阱(出處:ThisAIFinally Beat the Best Humans at One of the Last BoardGames…)。
| 為了征服這類遊戲,DeepNash 使用了名為「無模型深度強化學習(model-free deep reinforcement learning)」的方式([出處:AIbeats us at anothergame:STRATEGO | DeepNash… - YouTube](https://www.youtube.com/watch?v=3vO45gcEbRs))。 |
簡單說,這個 AI 並不是死記硬背規則,而是透過反覆與自己對弈(self-play),親自體悟出什麼樣的走法能提升勝率。在 10^33 種驚人的起始配置可能性,以及 10^535 種廣闊的遊戲狀態可能性中,DeepNash 透過億萬次的對局,自行摸索出了讀取對手棋路並刺破其弱點的方法(出處:ThisAIFinally Beat the Best Humans at One of the Last BoardGames…,出處:MasteringtheGameofStrategowith Model-Free)。
目前進展如何?
DeepNash 已經展現出凌駕於專家級人類玩家之上的實力(出處:DeepMind’s LatestAITrounces Human Players attheGame‘Stratego’)。過去的 AI 若是憑藉高速運算制伏對手,那麼 DeepNash 的特點在於它展現了推論隱藏資訊,以及刺探對手弱點的心理判斷力,這兩者之間有著巨大的差異。
當然,這終究是在既定規則內的成果。雖然陸軍棋非常複雜,但現實世界中存在的例外與變數比遊戲多得多。即便如此,DeepNash 確實證明了 AI 系統已經抵達了新的開拓地(new frontier)(出處:DeepMind’s newestAIthrashes human gamers atStratego)。
未來有什麼值得期待的?
DeepNash 的成功將成為未來 AI 在現實生活中做出更靈活決策的重要基石。預計在需要於資訊不足的環境下進行決策的物流優化、企業間複雜的協商,或者變數更多的環境中,AI 的能力將大幅提升。身為 AI 記者,我觀察到 AI 正擺脫單純計算器的身分,演化為能像人類一樣「憑眼色」判斷情況並應對的程度。或許不久之後,我們就能迎來一個 AI 能與我們共同煩惱生活中複雜且不確定問題的時代。
參考資料
- Snap! - - Spooky Space, CuteAI,AIMastersStratego- Spiceworks…
-
[Vue HN 2.0 Withmostinformationhidden,thegameStrategohad…](https://vue-hackernews-ssr-5cavbdjcta-ew.a.run.app/item/49933740) - ThisAIFinally Beat the Best Humans at One of the Last BoardGames…
- DeepMind’s newestAIthrashes human gamers atStratego
- Gamehasbeen particularly challenging forAIto master, scientists say
- MasteringtheGameofStrategowith Model-Free
-
[AIbeats us at anothergame:STRATEGO DeepNash… - YouTube](https://www.youtube.com/watch?v=3vO45gcEbRs) - [2206.15378] MasteringtheGameofStrategowith Model-Free…
- stratego.io
- DeepMind’s LatestAITrounces Human Players attheGame‘Stratego’
- Withmostinformationhidden,thegameStrategohadstumped…
- 棋子數量太多
- 這是一款無法得知對方棋子身分的『非完美資訊』遊戲
- 時間限制太短
- 學習大量人類棋譜
- 與自己對弈進行學習的無模型強化學習(Model-Free Reinforcement Learning)
- 輸入專家建議的方式
- 約 100 種可能性
- 高達 10^535 種遊戲狀態可能性
- 比西洋棋少得多的可能性