AI 能解物理題?我們熟知的成績單或許全是『虛假』的

複雜的物理公式與人工智慧神經網路結構交織的精緻數位插圖
AI Summary

根據最新研究,現行評估 AI 物理能力的測試方式存在嚴重缺陷。專家親自重新評分後發現,AI 的物理問題解決能力其實已經達到頂峰。

想像一下。你在學生時代參加物理考試,考卷上的解題過程、公式與最終結果都完美無缺,但老師卻以「答錯」為由給你零分。這會有多冤枉?最近在人工智慧(AI)產業,正發生著這樣的事情。過去我們一直相信「最新的 AI 模型在物理領域依然陷入苦戰」,但事實證明,這種評估標準本身就是「故障」的。

這為何重要?

單純評估 AI 解物理題的好壞,其意義遠超考試分數本身。物理問題與單純羅列單字截然不同。要解題,必須掌握正在發生的狀況(識別物理模型)、考量需要什麼先決條件(設定假設),最後選擇合適的數學公式進行精確計算,這需要複雜的推理過程([出處:HowGoodAreFrontierModelsatPhysics? alphaXiv](https://www.alphaxiv.org/abs/2609.13009))。

換句話說,物理是判斷 AI 是否真的在「思考」,而不僅僅是「複製」數據的極佳指標。如果 AI 能完美解答物理問題,我們就有理由期待 AI 在一定程度上理解現實世界的運作原理。

簡單理解:『故障』的答案卷

為什麼過去我們會認為 AI 不擅長物理?用一個簡單的比喻:我們讓 AI 解一道非常困難的謎題,但該謎題的評分方式一團糟。

耶魯大學的 John Sous 指出,現有的物理基準測試(性能評估工具)存在一個問題,即 AI 即使答對了,仍會被一致判為錯誤([出處:Howgoodarefrontiermodelsatphysics? Hacker News](https://news.ycombinator.com/item?id=49731620))。這就像是答案卷上要求寫「5」,結果因為寫成「五」就被判錯一樣。
研究團隊發現此問題後,由人工重新評閱 AI 的試卷。結果令人震驚:所謂的「前沿模型」(當前技術最頂尖的模型),其成績早已達到現有物理評估工具的最高點(達到飽和狀態)([出處:2609.13009v1 How Good Are Frontier Models at Physics?](https://arxiv.org/abs/2609.13009),[出處:How Good Are Frontier Models at Physics? arXiv](https://arxiv.org/abs/2609.13009))。

這就好比以為是個每天只能解小學算術題的孩子,事實上卻已經具備了解大學數學題的能力。

我們現在處於什麼位置?

那麼,AI 現在已經通曉世間萬物之物理了嗎?並不盡然。研究顯示,雖然 AI 模型在觀察物體並識別物體位置的「辨識能力」上表現出色,但在預測該物體未來移動路徑的「物理推理」上,有時仍會顯露極限(出處:Does Physics Knowledge Emerge in Frontier Models? — Lacuna)。

也就是說,它很清楚蘋果在那裡,但計算蘋果掉落時會畫出何種精確軌跡並掉落何處,則是另一回事。高辨識準確度並不直接等同於具備深度的物理邏輯能力(出處:Does Physics Knowledge Emerge in Frontier Models? — Lacuna)。

未來會如何發展?

John Sous 將這種現象描述為「有點令人畏懼的事」([出處:Howgoodarefrontiermodelsatphysics? Hacker News](https://news.ycombinator.com/item?id=49731620))。因為在我們連衡量 AI 能力的工具都無法妥善建立的同時,AI 可能已經遠遠領先於我們的想像。

未來,我們需要超越以單純解題為中心的評估,引入更精密的評估方法,以衡量 AI 對物理定律的邏輯理解與應用能力。現在,技術發展速度已經完全超越了評估體系,對我們而言,除了需要駕馭 AI 的技術外,更需要一把能精確審視 AI 的「放大鏡」。

參考資料

  1. [2609.13009v1] How Good Are Frontier Models at Physics? (https://arxiv.org/abs/2609.13009v1)
  2. How Good Are Frontier Models at Physics? alphaXiv (https://www.alphaxiv.org/abs/2609.13009)
  3. How good are frontier models at physics? Hacker News (https://news.ycombinator.com/item?id=49731620)
  4. [2609.13009] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://arxiv.org/abs/2609.13009)
  5. [Paper Note] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://github.com/AkihikoWatanabe/paper_notes/issues/6574)
  6. How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://arxiv.org/html/2609.13009)
  7. Does Physics Knowledge Emerge in Frontier Models? — Lacuna (https://lacuna.tiptreesystems.com/work/does-physics-knowledge-emerge-in-frontier-models/wrk_5011f7d6acc6fe82d5198eb25de3c61d)
AD
測試你的理解
Q1. 現有的物理基準測試(評估工具)所面臨的最大問題是什麼?
  • AI 覺得太簡單而感到無趣
  • 即使答對了仍被評為錯誤
  • 完全沒有包含物理公式
研究結果顯示,許多現有的物理基準測試存在錯誤,即使 AI 給出了正確答案,仍會被判為錯誤。
Q2. 物理問題解決能力對 AI 為何如此重要?
  • 僅為了確認記憶力
  • 因為需要選擇物理模型、設定假設、推導公式等複雜推理能力
  • 因為 AI 的目標是成為物理學家
物理問題不僅僅是尋找模式,還需要選擇合適的模型、設定假設並精確操作公式,因此需要高度的推理能力。
Q3. 經專家手動重新評分後,目前前沿模型的實力達到什麼程度?
  • 依然停留在基礎水準
  • 展現出平均水準的實力
  • 優秀到足以達到現有基準測試的最高分
與現有較低的得分不同,經專家親自重新評分後發現,最新模型已經達到了該基準測試的最高水準。