AI가 물리 문제를 푼다고? 우리가 알던 성적표가 사실은 '가짜'일 수 있습니다

복잡한 물리학 수식과 인공지능 신경망 구조가 교차하는 세련된 디지털 일러스트
AI Summary

최신 연구에 따르면 AI의 물리학 실력을 평가하는 기존 시험 방식이 크게 잘못되어 있었습니다. 전문가들이 직접 다시 채점해보니, AI는 이미 물리학 문제 해결 능력을 최고치까지 끌어올린 상태였습니다.

상상해보세요. 여러분이 학생 시절 물리 시험을 봤는데, 답안지에 적힌 풀이 과정과 공식, 결과값이 완벽함에도 불구하고 선생님이 “오답”이라며 0점을 줍니다. 억울하겠죠? 최근 인공지능(AI) 업계에서 바로 이런 일이 벌어지고 있었습니다. 그동안 우리는 “최신 AI 모델들이 물리학 분야에서는 여전히 고전하고 있다”고 믿어왔는데, 알고 보니 이 평가 기준 자체가 ‘고장 난’ 상태였던 것입니다.

이게 왜 중요한가요?

단순히 AI가 물리학 문제를 얼마나 잘 푸느냐는 시험 점수 이상의 의미를 갖습니다. 물리학 문제는 단순히 단어를 나열하는 것과는 차원이 다릅니다. 문제를 풀기 위해서는 무엇이 벌어지고 있는지 상황을 파악하고(물리적 모델 식별), 어떤 전제 조건이 필요한지 따져본 뒤(가정 설정), 적절한 수학 공식을 골라 정확하게 계산하는 복잡한 추론 과정이 필요합니다([출처: HowGoodAreFrontierModelsatPhysics? alphaXiv](https://www.alphaxiv.org/abs/2609.13009)).

즉, 물리학은 AI가 단순히 데이터를 ‘베끼는’ 것이 아니라 실제로 ‘생각’을 하고 있는지 판단할 수 있는 아주 좋은 척도입니다. 만약 AI가 물리 문제를 완벽하게 풀 수 있다면, 우리는 AI가 실제 세상의 원리를 어느 정도 이해하고 있다고 기대할 수 있습니다.

쉽게 이해하기: ‘고장 난’ 정답지

왜 그동안 AI가 물리학을 못한다고 생각했을까요? 쉽게 비유하자면 이렇습니다. 우리가 AI에게 아주 어려운 퍼즐을 풀게 했는데, 그 퍼즐의 채점 방식이 엉망이었던 것입니다.

예일대의 존 소스(John Sous)는 기존 물리학 벤치마크(성능 평가 도구)들이 AI가 정답을 맞혔음에도 불구하고 일관되게 틀렸다고 처리하는 문제를 지적했습니다([출처: Howgoodarefrontiermodelsatphysics? Hacker News](https://news.ycombinator.com/item?id=49731620)). 마치 정답지에 ‘5’라고 써야 하는데, ‘오’라고 적었다고 해서 틀렸다고 채점하는 셈입니다.
연구팀이 이 문제를 발견하고, AI의 답안을 사람이 하나하나 다시 채점해보았습니다. 그 결과는 놀라웠습니다. 소위 ‘프론티어 모델(현재 기술의 최첨단에 있는 모델)’이라 불리는 최신 AI들은 이미 기존 물리 평가 도구의 점수를 최고치까지 달성(포화 상태)한 상태였습니다([출처: 2609.13009v1 How Good Are Frontier Models at Physics?](https://arxiv.org/abs/2609.13009), [출처: How Good Are Frontier Models at Physics? arXiv](https://arxiv.org/abs/2609.13009)).

이를 비유하자면, 매일 쉬운 초등 수학 문제만 풀던 아이인 줄 알았는데, 사실은 이미 대학교 수학 문제를 풀 수 있는 실력을 갖추고 있었던 것입니다.

현재 우리는 어디에 서 있나요?

그렇다면 AI는 이제 세상 모든 물리를 통달했을까요? 꼭 그렇지는 않습니다. 연구에 따르면 AI 모델들은 여전히 물체를 보고 무엇이 어디에 있는지 파악하는 ‘인식 능력’에는 능숙하지만, 그 물체가 앞으로 어떻게 움직일지 예측하는 ‘물리적 추론’에는 여전히 한계를 보일 때가 있습니다(출처: Does Physics Knowledge Emerge in Frontier Models? — Lacuna).

즉, 사과가 거기에 있다는 건 잘 알지만, 사과를 떨어뜨렸을 때 정확히 어떤 궤적을 그리며 어디에 떨어질지를 계산하는 것은 별개의 문제입니다. 높은 인식 정확도가 곧바로 깊이 있는 물리적 논리력으로 이어지지는 않는다는 것이죠(출처: Does Physics Knowledge Emerge in Frontier Models? — Lacuna).

앞으로 어떻게 될까?

존 소스는 이런 현상을 두고 “조금 겁나는 일”이라고 표현했습니다([출처: Howgoodarefrontiermodelsatphysics? Hacker News](https://news.ycombinator.com/item?id=49731620)). 우리가 AI의 능력을 측정하는 도구조차 제대로 만들지 못하는 사이, AI는 이미 우리가 생각한 것보다 훨씬 앞서나가고 있을 수 있기 때문입니다.

앞으로는 단순한 문제 풀이 중심의 평가를 넘어, AI가 물리 법칙을 얼마나 논리적으로 이해하고 적용하는지 측정하는 더욱 정교한 평가 방법이 도입되어야 할 것입니다. 기술의 발전 속도가 평가 체계를 완전히 앞질러 버린 지금, 우리에게는 AI를 다루는 기술만큼이나 AI를 정확히 들여다보는 정밀한 ‘돋보기’가 필요합니다.

참고자료

  1. [2609.13009v1] How Good Are Frontier Models at Physics? (https://arxiv.org/abs/2609.13009v1)
  2. How Good Are Frontier Models at Physics? alphaXiv (https://www.alphaxiv.org/abs/2609.13009)
  3. How good are frontier models at physics? Hacker News (https://news.ycombinator.com/item?id=49731620)
  4. [2609.13009] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://arxiv.org/abs/2609.13009)
  5. [Paper Note] How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://github.com/AkihikoWatanabe/paper_notes/issues/6574)
  6. How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks (https://arxiv.org/html/2609.13009)
  7. Does Physics Knowledge Emerge in Frontier Models? — Lacuna (https://lacuna.tiptreesystems.com/work/does-physics-knowledge-emerge-in-frontier-models/wrk_5011f7d6acc6fe82d5198eb25de3c61d)
AD
이 글을 얼마나 이해했나요?
Q1. 기존의 물리 벤치마크(평가 도구)가 가진 가장 큰 문제점은 무엇인가요?
  • AI가 너무 쉬워서 재미를 느끼지 못함
  • 정답을 맞혔음에도 틀린 것으로 채점함
  • 물리학 공식이 아예 포함되지 않음
연구 결과에 따르면 기존의 많은 물리 벤치마크는 AI가 정답을 제시했음에도 불구하고 이를 오답으로 처리하는 오류를 범하고 있었습니다.
Q2. 물리학 문제 해결 능력이 AI에게 중요한 이유는 무엇인가요?
  • 단순히 암기력을 확인하기 위해
  • 물리적 모델 선택, 가정 설정, 수식 유도 등 복잡한 추론 능력이 필요하기 때문
  • AI가 물리학자가 되는 것이 목표이기 때문
물리학 문제는 단순히 패턴을 찾는 것이 아니라, 적절한 모델을 선택하고 가정을 설정하며 수식을 정확하게 조작해야 하므로 고도의 추론 능력이 필요합니다.
Q3. 전문가들이 수동으로 다시 채점한 결과, 현재의 프론티어 모델 실력은 어느 정도인가요?
  • 여전히 기초적인 수준에 머물러 있음
  • 평균 정도의 실력을 보임
  • 기존 벤치마크의 최대 점수에 도달할 정도로 우수함
기존의 낮은 점수와 달리 전문가들이 직접 다시 채점해보니, 최신 모델들은 이미 해당 벤치마크의 최고점에 도달한 상태였습니다.
AI가 물리 문제를 푼다고? 우리가 알던 성적표가...
0:00