AI会做物理题吗?我们熟悉的成绩单可能其实是“伪造”的

展现复杂物理公式与人工智能神经网络结构交织的精致数字插画
AI Summary

最新研究显示,评价AI物理能力的现有测试方式存在重大缺陷。经专家重新评分后发现,AI的物理问题解决能力实际上已经达到了顶峰。

想象一下。你在学生时代参加物理考试,答卷上的解题过程、公式和结果都完美无缺,老师却告诉你“回答错误”,并给了你零分。你会觉得委屈吗?最近,人工智能(AI)领域正在上演同样的一幕。长期以来,我们一直认为“最新AI模型在物理领域依然挣扎”,但事实证明,这种评估标准本身就是“损坏”的。

这为什么重要?

AI在物理题上表现如何,其意义远超考试分数。物理问题与单纯的词语罗列有着本质区别。为了解答这些问题,AI需要识别正在发生的现象(识别物理模型)、考量需要哪些前提条件(设定假设),并选择合适的数学公式进行精确计算,这一过程需要复杂的推理能力([出处: HowGoodAreFrontierModelsatPhysics? alphaXiv](https://www.alphaxiv.org/abs/2609.13009))。

换句话说,物理学是衡量AI是否真的在“思考”,而非仅仅是“复制”数据的极佳尺度。如果AI能完美解答物理题,我们可以期待AI在某种程度上理解了现实世界的原理。

简单易懂:一份“损坏”的参考答案

为什么我们一直以为AI不擅长物理呢?简单打个比方。我们让AI解答一道极难的拼图,但拼图的评分方式却一塌糊涂。

耶鲁大学的约翰·索斯(John Sous)指出了现有物理基准(性能评估工具)的问题:即便AI给出了正确答案,它们也被系统一致判定为错误([出处: Howgoodarefrontiermodelsatphysics? Hacker News](https://news.ycombinator.com/item?id=49731620))。这就像参考答案上要求写“5”,因为你写了“五”就被判定为错误一样。
研究小组发现此问题后,由专家对AI的答卷进行了逐一重新评分。结果令人震惊。所谓的“前沿模型(当前技术最尖端的模型)”在现有的物理评估工具中,得分其实已经达到饱和状态([出处: 2609.13009v1 How Good Are Frontier Models at Physics?](https://arxiv.org/abs/2609.13009), [出处: How Good Are Frontier Models at Physics? arXiv](https://arxiv.org/abs/2609.13009))。

这就好比我们一直以为是一个只会做简单小学数学题的孩子,其实早已具备了解决大学数学题的能力。

我们现在处于什么位置?

那么,AI现在是否已经精通世间万物之理了呢?并不尽然。研究表明,虽然AI模型在观察物体并识别其位置的“感知能力”上表现出色,但在预测物体未来运动轨迹的“物理推理”方面,有时仍会显露局限性(出处: Does Physics Knowledge Emerge in Frontier Models? — Lacuna)。

也就是说,它很清楚苹果在那里,但要计算苹果掉落时会划出怎样的轨迹并落在何处,则是另一回事。高感知准确率并不直接等同于深层次的物理逻辑能力(出处: Does Physics Knowledge Emerge in Frontier Models? — Lacuna)。

未来会怎样?

约翰·索斯将这种现象描述为“有些可怕”([出处: Howgoodarefrontiermodelsatphysics? Hacker News](https://news.ycombinator.com/item?id=49731620))。因为在我们甚至无法制定出妥善衡量AI能力的工具期间,AI可能已经远远领先于我们的想象。

未来,我们需要超越以单纯解题为中心的评估方式,引入更加精密的评估方法,以衡量AI对物理定律的理解与应用逻辑。在技术发展速度完全超越评价体系的今天,我们不仅需要驾驭AI的技术,更需要一把能精准洞察AI能力的“放大镜”。

参考资料

  1. [2609.13009v1] How Good Are Frontier Models at Physics? (https://arxiv.org/abs/2609.13009v1)
  2. How Good Are Frontier Models at Physics? alphaXiv (https://www.alphaxiv.org/abs/2609.13009)
  3. How good are frontier models at physics? Hacker News (https://news.ycombinator.com/item?id=49731620)
  4. [2609.13009] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://arxiv.org/abs/2609.13009)
  5. [Paper Note] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://github.com/AkihikoWatanabe/paper_notes/issues/6574)
  6. How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://arxiv.org/html/2609.13009)
  7. Does Physics Knowledge Emerge in Frontier Models? — Lacuna (https://lacuna.tiptreesystems.com/work/does-physics-knowledge-emerge-in-frontier-models/wrk_5011f7d6acc6fe82d5198eb25de3c61d)
AD
测试你的理解
Q1. 现有的物理基准测试(评估工具)面临的最大问题是什么?
  • AI觉得题目太简单而感到无趣
  • 即使回答正确也被判定为错误
  • 完全不包含物理公式
研究结果表明,许多现有的物理基准测试存在错误,即使AI给出了正确答案,也会被判定为错误。
Q2. 物理问题解决能力对AI而言为何重要?
  • 仅仅是为了验证记忆力
  • 因为需要识别物理模型、设定假设、推导公式等复杂的推理能力
  • 因为AI的目标是成为物理学家
物理问题不仅仅是模式识别,还需要选择合适的模型、设定假设并精确操纵公式,因此需要高度的推理能力。
Q3. 经专家手动重新评分后,目前前沿模型的水平如何?
  • 仍处于基础水平
  • 表现出平均水平
  • 优异到足以达到现有基准测试的最高分
与此前的低分不同,经专家亲自重新评分后发现,最新模型已经达到了该基准测试的最高分。