다양한 AI 모델들이 팩맨 게임에서 실시간으로 유령을 피하며 얼마나 정확하고 빠르게 판단을 내리는지 측정하는 오픈소스 벤치마크 프로젝트 '제브맨'을 다룹니다.
상상해보세요. 당신이 아케이드 게임기 앞에 앉아 팩맨(Pac-Man)을 조종하고 있습니다. 화면 속 유령들이 빠른 속도로 당신을 추격해오죠. 여기서 당신은 0.1초마다 ‘왼쪽으로 갈까, 오른쪽으로 갈까?’를 결정해야 합니다. 사람이 한다면 땀을 쥐게 만드는 이 긴박한 순간, 인공지능(AI)은 과연 어떻게 판단하고 있을까요?
최근 AI의 판단력을 실시간으로 테스트하기 위해 아주 흥미로운 ‘팩맨 벤치마크’가 등장했습니다. 바로 제브맨(Jevman)입니다.
이게 왜 중요한가요?
우리가 평소 사용하는 똑똑한 AI들은 긴 문장을 읽고 내용을 요약하는 데는 능숙하지만, 아주 짧은 시간 안에 즉각적인 판단을 내려야 하는 상황에서는 어떤 실력을 보일까요?
제브맨은 이러한 AI의 ‘결정(Decision-making)’ 능력을 시험하기 위해 만들어졌습니다. 우리가 일상에서 AI에게 “지금 바로 우산을 챙겨야 할까?”라거나 “이 투자 건을 수락할까?” 같은 판단을 맡길 때, AI는 매우 짧은 시간 내에 복잡한 상황을 분석해야 합니다. 팩맨은 유령의 움직임을 보고 길을 찾는 과정이 이러한 복잡한 의사결정 과정을 시뮬레이션하기에 최적의 환경을 제공합니다.
| 쉽게 말해서, 제브맨은 AI가 단순한 언어 지식을 넘어, 실시간으로 급박한 상황에서 얼마나 빠르고 정확하게 올바른 행동을 선택하는지를 객관적으로 평가하는 일종의 ‘AI 두뇌 시험장’인 셈입니다. [[출처: jevman: AI decision models play Pac-Man | VibeLeaderboard](https://www.vibeleaderboard.ai/app/17f8acd3-69b1-4c04-b083-30957220898d)] |
쉽게 이해하기
‘제브맨’이 수행하는 테스트는 마치 “AI를 위한 운전면허 실기 시험”과 같습니다.
- 상황 인식 (State): AI 모델은 현재 팩맨이 어디에 있고, 유령이 어디에 있는지 화면의 상태를 정보로 전달받습니다. [출처: GitHub - denis-shvets/jevman-benchmark: Pac-Man driven by the …]
-
판단 (System One decision): ‘시스템 원(System One)’이라고 불리는, 빠르고 본능적인 의사결정 모델이 이 정보를 분석합니다. 비유하자면 뜨거운 냄비에 손이 닿았을 때 반사적으로 피하는 것과 같은 직관적 판단입니다. [[출처: Jev: System One Decision Model Explained AIJev](https://aijev.org/)] - 행동 (Action): AI는 판단 결과에 따라 위, 아래, 왼쪽, 오른쪽 중 하나를 결정하여 팩맨을 이동시킵니다. [출처: GitHub - codaaiteam/jev-pacman: You drive Pac-Man; Jev…]
| 이 과정이 아주 짧은 밀리초(ms) 단위로 반복됩니다. 이를 초보 운전자가 도로의 차선과 신호등을 보고 핸들을 꺾는 과정에 비유한다면, AI는 게임 속에서 팩맨을 조종하며 운전 실력을 키우고 있는 셈이죠. 현재 이 시험장에 참여한 6개의 AI 모델(jev 1.13, kev, clef, clef flash, GPT-6 Luna, Laya 등)은 각자 100번씩 팩맨 게임을 치르며 자신의 판단력을 증명하고 있습니다. [[출처: jevman: AI decision models play Pac-Man | TheaterFire](https://theaterfi.re/post/3741604), [출처: Jevman: AI Decision Models Play Pac-Man | VibeLeaderboard](https://www.vibeleaderboard.ai/app/17f8acd3-69b1-4c04-b083-30957220898d)] |
현재 상황
| 제브맨은 단순히 AI가 게임을 즐긴다는 사실에 그치지 않습니다. 모든 게임 기록은 공개되어 누구나 시청할 수 있고, 누가 더 높은 점수를 냈는지 한눈에 확인할 수 있는 공식 리더보드가 존재합니다. [[출처: jevman: a Pac-Man benchmark for decision models | OpperAI](https://opper.ai/jevman-benchmark/), 출처: jevman — Six AI decision models play Pac-Man, ranked live] |
더 흥미로운 점은 이 프로젝트가 오픈소스라는 것입니다. 즉, AI 개발자라면 누구나 자신의 모델을 제브맨 벤치마크에 등록하여 성능을 측정해볼 수 있습니다. 심지어 일반 사용자들도 직접 팩맨을 플레이해 보면서, 자신의 점수와 AI 모델들의 점수를 실시간으로 비교해 볼 수 있습니다. “과연 사람이 AI보다 더 나은 판단을 내릴까?”라는 궁금증을 직접 확인할 수 있는 것이죠. [출처: jevman · Can you beat the AI at Pac-Man?, 출처: jevman — Six AI decision models play Pac-Man, ranked live]
앞으로 어떻게 될까?
제브맨 같은 게임 기반의 벤치마크는 앞으로 더 많아질 것입니다. AI가 단순히 지식을 뽐내는 단계를 넘어, 실제 우리 일상 속에서 소프트웨어를 제어하고 비즈니스 규칙에 맞춰 자동 결정을 내리는 ‘행동하는 AI’로 진화하고 있기 때문입니다.
이제 우리는 AI를 선택할 때 단순히 “누가 더 말을 잘하나”가 아니라, “누가 더 급박한 상황에서 실수 없이 올바른 판단을 하나”를 고민하게 될 것입니다. 제브맨은 그런 미래를 준비하기 위해 AI들에게 내어준 팩맨 게임이라는 즐거운 연습장인 셈입니다.
MindTickleBytes의 AI 기자 시선: AI가 방대한 논문을 읽고 창작을 하는 것도 놀랍지만, 팩맨처럼 긴박한 게임 속에서 실수를 줄여나가는 과정을 지켜보는 것은 AI의 ‘실전 근육’을 보는 것 같아 훨씬 더 현실적으로 느껴집니다. 앞으로 더 많은 ‘게임형 벤치마크’가 등장해 AI의 판단력을 더욱 정교하게 검증해주길 기대합니다.
참고자료
-
[jevman: a Pac-Man benchmark for decision models OpperAI](https://opper.ai/jevman-benchmark/) - jevman · Can you beat the AI at Pac-Man?
- GitHub - joch/jevman: Pac-Man driven by the jev decision model
-
[jevman: AI decision models play Pac-Man TheaterFire](https://theaterfi.re/post/3741604) - Show HN: Jevman – AI decision models play Pac-Man
- jevman — Six AI decision models play Pac-Man, ranked live
- GitHub - denis-shvets/jevman-benchmark: Pac-Man driven by the …
-
[Jevman: AI Decision Models Play Pac-Man VibeLeaderboard](https://www.vibeleaderboard.ai/app/17f8acd3-69b1-4c04-b083-30957220898d) -
[Jev: System One Decision Model Explained AIJev](https://aijev.org/) - GitHub - codaaiteam/jev-pacman: You drive Pac-Man; Jev…
- AI의 그래픽 처리 능력을 테스트한다
- AI 모델의 실시간 빠르고 정확한 판단력을 테스트한다
- AI가 얼마나 오래 게임을 할 수 있는지 겨룬다
- 모델당 10번씩 총 50게임을 플레이했다
- 모델당 100게임씩 총 6개의 모델이 플레이했다
- 사람과 AI가 1:1로 대결했다
- 유료 서비스로만 접근할 수 있다
- 결과를 외부로 공개하지 않는다
- 오픈소스로 누구나 자신의 모델을 제출할 수 있다