AI가 똑똑해지는 줄 알았는데, 사실은 고민만 깊어지고 있었다고요?

복잡한 회로도 위에 수많은 화살표가 얽혀 있는 가운데, AI가 결정을 내리지 못하고 고민하는 모습을 추상적으로 표현한 이미지.
AI Summary

AI 모델을 효율적으로 만들기 위해 크기를 줄이는 '양자화' 기술이 오히려 AI를 과도하게 생각하게 만들어 중간에 정답을 찾고도 최종 답변에서 틀리게 만드는 현상이 발견되었습니다.

상상해 보세요. 수학 문제를 푸는데 우리는 이미 머릿속으로 정답을 알고 있습니다. 그런데 ‘혹시 이게 아닌가?’ 하는 의심이 꼬리에 꼬리를 물고 이어지다가, 결국 시험 종료 시간이 다 지나가 버리고 답안지에는 아무것도 쓰지 못하게 되는 상황 말이죠. 최근 인공지능(AI) 세계에서 이와 똑같은 일이 벌어지고 있다는 사실이 밝혀졌습니다.

흔히 AI 모델은 크기가 클수록 똑똑하다고 알려져 있습니다. 하지만 이 모델들을 일반 사용자들의 컴퓨터나 스마트폰에서 가볍게 실행하기 위해 크기를 줄이는 ‘양자화(Quantization, 모델의 정밀도를 낮추어 효율을 높이는 기술)’라는 작업을 거치게 됩니다. 놀랍게도 이 작업을 거친 AI 모델들이 필요 이상으로 ‘고민’만 깊게 하다가 스스로 정답을 놓쳐버리는 현상이 나타난 것입니다.

이게 왜 중요한가요?

우리 삶에서 AI의 비중은 점점 커지고 있습니다. 하지만 거대한 AI 모델을 그대로 실행하기에는 너무 많은 전력과 고성능 장비가 필요합니다. 그래서 개발자들은 모델의 크기를 줄여 스마트폰 같은 개인 기기에서도 AI를 원활하게 쓰고 싶어 합니다.

이번 연구는 AI를 효율적으로 만드는 과정에서 우리가 놓치고 있던 ‘숨겨진 부작용’을 지적합니다. AI가 정답을 이미 찾았음에도 불구하고, 스스로를 의심하며 논리적 사고 과정(Chain of Thought, AI가 답에 도달하기 위해 논리적 단계를 밟아 생각하는 과정)을 지나치게 길게 늘어뜨린다면, 우리는 결국 더 느리고 부정확한 답변을 얻게 되는 셈입니다. 이는 단순히 기술적인 문제가 아니라, 우리가 매일 사용하는 AI 서비스의 품질과 직결되는 중요한 발견입니다. 출처 14

쉽게 이해하기: ‘완벽주의자 학생’의 딜레마

이렇게 비유해 보겠습니다. 공부를 아주 잘하는 학생이 있는데, 시험 문제의 답을 이미 알고 있음에도 불구하고, ‘내가 혹시 실수를 한 건 아닐까?’ 하는 불안감에 빠져서 문제지에 적었던 답을 지우고, 다시 풀고, 또 새로운 풀이 방식을 찾으려다 시험 종료 종소리를 듣는 것과 같습니다.

메타 AI(Meta AI) 연구팀의 발표에 따르면, 양자화된 논리적 추론 모델들이 바로 이런 행동을 보입니다. 출처 3 이 모델들은 문제를 풀다가 중간에 이미 정답에 도달했습니다. 하지만 그 정답을 확신하지 못하고, 불필요한 새로운 사고의 가지를 뻗어나가며 스스로 의심의 늪에 빠져버리는 것이죠. 결과적으로는 정답을 내놓지 못하거나, 잘못된 결론에 도달하게 됩니다. 실제로 연구 결과, 양자화된 모델이 문제를 틀리는 사례 중 무려 52%는 모델이 이미 중간 과정에서 정답을 알고 있었던 경우였습니다. 출처 1, 출처 5

어디까지 왔을까: 과도한 생각 끊어내기

연구진은 이 문제를 해결하기 위해 재미있는 시도를 했습니다. AI가 생각하는 과정에서 ‘하지만’, ‘잠깐’처럼 과도한 의심을 시작하게 만드는 특정 신호(Thinking markers)를 감지하고, 이에 대해 ‘로짓 페널티(Logit penalty, 특정 단어나 표현을 출력하지 않도록 확률을 낮추는 기술)’를 적용했습니다. 출처 2, 출처 13

쉽게 말해, 학생이 쓸데없는 고민을 시작하려고 할 때마다 옆에서 “그건 이미 정답이야, 그냥 써!”라고 말해주는 선생님을 붙여준 것과 같습니다. 이 기술을 적용했더니, 여러 모델과 벤치마크에서 AI의 불필요한 고민 시간(논리적 사고 과정 길이)이 12%에서 23%까지 줄어들었고, 결과적으로 더 효율적이고 정확한 답변을 얻을 수 있었습니다. 출처 2

앞으로 어떻게 될까?

이번 연구는 AI 개발의 방향성에 큰 시사점을 줍니다. 단순히 AI 모델의 용량을 줄이는 것이 능사가 아니라는 점입니다. 앞으로 개발자들은 AI 모델의 크기를 줄이더라도, 그 안에 내재된 논리적 사고력이 훼손되지 않도록 하는 ‘똑똑한 압축 기술’을 더 깊게 연구해야 할 것입니다.

우리는 이제 AI가 얼마나 긴 글을 써내느냐가 아니라, 얼마나 군더더기 없이 정확한 판단을 내리느냐에 주목하게 될 것입니다. 다음에 여러분이 AI와 대화할 때 AI가 조금 더 똑똑하고 명쾌해졌다고 느낀다면, 그건 아마 AI가 더 이상 쓸데없는 고민을 하지 않도록 교육받았기 때문일지도 모릅니다.

MindTickleBytes의 AI 기자 시선

이번 메타 AI의 연구는 ‘더 많이 생각하는 것이 반드시 더 나은 결과를 낳지는 않는다’는 인생의 진리를 AI에도 적용할 수 있다는 점이 매우 흥미롭습니다. AI 모델을 효율화하는 작업이 오히려 모델의 ‘자기 객관화’ 능력을 떨어뜨릴 수 있다는 점은 향후 AI 개발 과정에서 반드시 고려해야 할 변수가 될 것으로 보입니다.

참고자료

  1. Quantized Reasoning Models Think They Need to Think Longer…
  2. Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
  3. Quantized Reasoning Models Think They Need to Think Longer…
  4. Quantized Reasoning Models Think They Need to Think Longer…
  5. Meta study finds quantized reasoning models struggle with …
  6. Quantized Reasoning Models Think They Need To Think Longer …
  7. Logit-Bias “Overthinking” Penalties in llama.cppQuantizations
  8. QuantizedReasoningModelsThinkTheyNeedtoThinkLonger…
  9. QuantizedReasoningModelsThinkTheyNeedtoThinkLonger…
  10. When aquantizedreasoningmodelfails, the natural assumption is…
  11. Think–Answer Mismatch inReasoningModels
  12. Quantized Reasoning Models Think They Need to Think Longer …
  13. Quantization Inflates Reasoning: Token Inflation as a Hidden …
AD
이 글을 얼마나 이해했나요?
Q1. 연구 결과에 따르면, 양자화된 AI 모델이 문제를 틀리는 경우 중 정답을 이미 중간 과정에서 찾은 비율은 최대 얼마인가요?
  • 12%
  • 23%
  • 52%
메타 AI의 연구에 따르면 양자화된 모델이 실패하는 사례 중 최대 52%는 모델이 이미 중간 단계에서 정답을 알고 있었음에도 최종 답변을 내놓지 못한 경우였습니다.
Q2. AI가 과도하게 생각하는 것을 막기 위해 연구진이 도입한 기술은 무엇인가요?
  • 학습 없이 적용하는 로짓 페널티
  • 추가적인 대규모 데이터 재학습
  • AI 모델의 크기 대폭 확장
연구진은 '하지만'이나 '잠깐'과 같이 AI가 불필요하게 고민을 시작하게 만드는 신호에 대해 학습 과정이 필요 없는 로짓 페널티를 적용했습니다.
Q3. 이번 연구의 주요 내용은 무엇인가요?
  • 양자화가 무조건 AI 성능을 향상시킨다
  • 양자화된 AI가 논리적 문제를 해결할 때 오히려 과도하게 고민하다가 틀리는 경우가 많다
  • 모든 AI 모델은 양자화할 필요가 없다
이번 연구는 AI 모델의 크기를 줄이는 양자화가 논리적 사고 모델의 정확도를 낮추고, 불필요하게 추론 과정만 길게 늘어뜨리는 부작용을 낳는다는 것을 밝혀냈습니다.
AI가 똑똑해지는 줄 알았는데, 사실은 고민만 깊...
0:00