根據最新研究,現行評估 AI 物理能力的測試方式存在嚴重缺陷。專家親自重新評分後發現,AI 的物理問題解決能力其實已經達到頂峰。
想像一下。你在學生時代參加物理考試,考卷上的解題過程、公式與最終結果都完美無缺,但老師卻以「答錯」為由給你零分。這會有多冤枉?最近在人工智慧(AI)產業,正發生著這樣的事情。過去我們一直相信「最新的 AI 模型在物理領域依然陷入苦戰」,但事實證明,這種評估標準本身就是「故障」的。
這為何重要?
| 單純評估 AI 解物理題的好壞,其意義遠超考試分數本身。物理問題與單純羅列單字截然不同。要解題,必須掌握正在發生的狀況(識別物理模型)、考量需要什麼先決條件(設定假設),最後選擇合適的數學公式進行精確計算,這需要複雜的推理過程([出處:HowGoodAreFrontierModelsatPhysics? | alphaXiv](https://www.alphaxiv.org/abs/2609.13009))。 |
換句話說,物理是判斷 AI 是否真的在「思考」,而不僅僅是「複製」數據的極佳指標。如果 AI 能完美解答物理問題,我們就有理由期待 AI 在一定程度上理解現實世界的運作原理。
簡單理解:『故障』的答案卷
為什麼過去我們會認為 AI 不擅長物理?用一個簡單的比喻:我們讓 AI 解一道非常困難的謎題,但該謎題的評分方式一團糟。
| 耶魯大學的 John Sous 指出,現有的物理基準測試(性能評估工具)存在一個問題,即 AI 即使答對了,仍會被一致判為錯誤([出處:Howgoodarefrontiermodelsatphysics? | Hacker News](https://news.ycombinator.com/item?id=49731620))。這就像是答案卷上要求寫「5」,結果因為寫成「五」就被判錯一樣。 |
| 研究團隊發現此問題後,由人工重新評閱 AI 的試卷。結果令人震驚:所謂的「前沿模型」(當前技術最頂尖的模型),其成績早已達到現有物理評估工具的最高點(達到飽和狀態)([出處:2609.13009v1 | How Good Are Frontier Models at Physics?](https://arxiv.org/abs/2609.13009),[出處:How Good Are Frontier Models at Physics? | arXiv](https://arxiv.org/abs/2609.13009))。 |
這就好比以為是個每天只能解小學算術題的孩子,事實上卻已經具備了解大學數學題的能力。
我們現在處於什麼位置?
那麼,AI 現在已經通曉世間萬物之物理了嗎?並不盡然。研究顯示,雖然 AI 模型在觀察物體並識別物體位置的「辨識能力」上表現出色,但在預測該物體未來移動路徑的「物理推理」上,有時仍會顯露極限(出處:Does Physics Knowledge Emerge in Frontier Models? — Lacuna)。
也就是說,它很清楚蘋果在那裡,但計算蘋果掉落時會畫出何種精確軌跡並掉落何處,則是另一回事。高辨識準確度並不直接等同於具備深度的物理邏輯能力(出處:Does Physics Knowledge Emerge in Frontier Models? — Lacuna)。
未來會如何發展?
| John Sous 將這種現象描述為「有點令人畏懼的事」([出處:Howgoodarefrontiermodelsatphysics? | Hacker News](https://news.ycombinator.com/item?id=49731620))。因為在我們連衡量 AI 能力的工具都無法妥善建立的同時,AI 可能已經遠遠領先於我們的想像。 |
未來,我們需要超越以單純解題為中心的評估,引入更精密的評估方法,以衡量 AI 對物理定律的邏輯理解與應用能力。現在,技術發展速度已經完全超越了評估體系,對我們而言,除了需要駕馭 AI 的技術外,更需要一把能精確審視 AI 的「放大鏡」。
參考資料
- [2609.13009v1] How Good Are Frontier Models at Physics? (https://arxiv.org/abs/2609.13009v1)
-
How Good Are Frontier Models at Physics? alphaXiv (https://www.alphaxiv.org/abs/2609.13009) -
How good are frontier models at physics? Hacker News (https://news.ycombinator.com/item?id=49731620) - [2609.13009] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://arxiv.org/abs/2609.13009)
- [Paper Note] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://github.com/AkihikoWatanabe/paper_notes/issues/6574)
- How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://arxiv.org/html/2609.13009)
- Does Physics Knowledge Emerge in Frontier Models? — Lacuna (https://lacuna.tiptreesystems.com/work/does-physics-knowledge-emerge-in-frontier-models/wrk_5011f7d6acc6fe82d5198eb25de3c61d)
- AI 覺得太簡單而感到無趣
- 即使答對了仍被評為錯誤
- 完全沒有包含物理公式
- 僅為了確認記憶力
- 因為需要選擇物理模型、設定假設、推導公式等複雜推理能力
- 因為 AI 的目標是成為物理學家
- 依然停留在基礎水準
- 展現出平均水準的實力
- 優秀到足以達到現有基準測試的最高分