最新研究显示,评价AI物理能力的现有测试方式存在重大缺陷。经专家重新评分后发现,AI的物理问题解决能力实际上已经达到了顶峰。
想象一下。你在学生时代参加物理考试,答卷上的解题过程、公式和结果都完美无缺,老师却告诉你“回答错误”,并给了你零分。你会觉得委屈吗?最近,人工智能(AI)领域正在上演同样的一幕。长期以来,我们一直认为“最新AI模型在物理领域依然挣扎”,但事实证明,这种评估标准本身就是“损坏”的。
这为什么重要?
| AI在物理题上表现如何,其意义远超考试分数。物理问题与单纯的词语罗列有着本质区别。为了解答这些问题,AI需要识别正在发生的现象(识别物理模型)、考量需要哪些前提条件(设定假设),并选择合适的数学公式进行精确计算,这一过程需要复杂的推理能力([出处: HowGoodAreFrontierModelsatPhysics? | alphaXiv](https://www.alphaxiv.org/abs/2609.13009))。 |
换句话说,物理学是衡量AI是否真的在“思考”,而非仅仅是“复制”数据的极佳尺度。如果AI能完美解答物理题,我们可以期待AI在某种程度上理解了现实世界的原理。
简单易懂:一份“损坏”的参考答案
为什么我们一直以为AI不擅长物理呢?简单打个比方。我们让AI解答一道极难的拼图,但拼图的评分方式却一塌糊涂。
| 耶鲁大学的约翰·索斯(John Sous)指出了现有物理基准(性能评估工具)的问题:即便AI给出了正确答案,它们也被系统一致判定为错误([出处: Howgoodarefrontiermodelsatphysics? | Hacker News](https://news.ycombinator.com/item?id=49731620))。这就像参考答案上要求写“5”,因为你写了“五”就被判定为错误一样。 |
| 研究小组发现此问题后,由专家对AI的答卷进行了逐一重新评分。结果令人震惊。所谓的“前沿模型(当前技术最尖端的模型)”在现有的物理评估工具中,得分其实已经达到饱和状态([出处: 2609.13009v1 | How Good Are Frontier Models at Physics?](https://arxiv.org/abs/2609.13009), [出处: How Good Are Frontier Models at Physics? | arXiv](https://arxiv.org/abs/2609.13009))。 |
这就好比我们一直以为是一个只会做简单小学数学题的孩子,其实早已具备了解决大学数学题的能力。
我们现在处于什么位置?
那么,AI现在是否已经精通世间万物之理了呢?并不尽然。研究表明,虽然AI模型在观察物体并识别其位置的“感知能力”上表现出色,但在预测物体未来运动轨迹的“物理推理”方面,有时仍会显露局限性(出处: Does Physics Knowledge Emerge in Frontier Models? — Lacuna)。
也就是说,它很清楚苹果在那里,但要计算苹果掉落时会划出怎样的轨迹并落在何处,则是另一回事。高感知准确率并不直接等同于深层次的物理逻辑能力(出处: Does Physics Knowledge Emerge in Frontier Models? — Lacuna)。
未来会怎样?
| 约翰·索斯将这种现象描述为“有些可怕”([出处: Howgoodarefrontiermodelsatphysics? | Hacker News](https://news.ycombinator.com/item?id=49731620))。因为在我们甚至无法制定出妥善衡量AI能力的工具期间,AI可能已经远远领先于我们的想象。 |
未来,我们需要超越以单纯解题为中心的评估方式,引入更加精密的评估方法,以衡量AI对物理定律的理解与应用逻辑。在技术发展速度完全超越评价体系的今天,我们不仅需要驾驭AI的技术,更需要一把能精准洞察AI能力的“放大镜”。
参考资料
- [2609.13009v1] How Good Are Frontier Models at Physics? (https://arxiv.org/abs/2609.13009v1)
-
How Good Are Frontier Models at Physics? alphaXiv (https://www.alphaxiv.org/abs/2609.13009) -
How good are frontier models at physics? Hacker News (https://news.ycombinator.com/item?id=49731620) - [2609.13009] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://arxiv.org/abs/2609.13009)
- [Paper Note] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://github.com/AkihikoWatanabe/paper_notes/issues/6574)
- How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://arxiv.org/html/2609.13009)
- Does Physics Knowledge Emerge in Frontier Models? — Lacuna (https://lacuna.tiptreesystems.com/work/does-physics-knowledge-emerge-in-frontier-models/wrk_5011f7d6acc6fe82d5198eb25de3c61d)
- AI觉得题目太简单而感到无趣
- 即使回答正确也被判定为错误
- 完全不包含物理公式
- 仅仅是为了验证记忆力
- 因为需要识别物理模型、设定假设、推导公式等复杂的推理能力
- 因为AI的目标是成为物理学家
- 仍处于基础水平
- 表现出平均水平
- 优异到足以达到现有基准测试的最高分