AI가 포켓몬 레드를 플레이하며 결정과 확률을 보여주는 Show HN 프로젝트다
Show HN에 'Jev Plays Pokémon Red'라는 프로젝트가 올라왔다. 이름 그대로 AI가 포켓몬 레드를 플레이하는 데모이며, 게임 화면 옆에 별도 패널을 붙여 AI가 어떤 판단을 내렸는지 실시간으로 드러내는 구성이다. 결과만 보여주는 자동 플레이 영상과 달리, 의사결정 과정 자체를 관찰 대상으로 삼은 점이 눈에 띈다.
구체적으로 오른쪽 패널은 AI가 내린 모든 결정과 각 선택지의 확률(승산)을 표시한다. 게임 오디오는 처음에 음소거 상태로 시작하고, 소리를 들으려면 사용자가 직접 음소거를 해제해야 한다. 즉 화면의 절반은 게임, 나머지 절반은 에이전트의 판단 로그에 할당된 셈이다.
이런 구성이 나온 배경에는 게임을 에이전트 평가 무대로 쓰는 흐름이 있다. 포켓몬 레드는 장기 목표, 부분적으로만 보이는 상태, 텍스트 기반 상호작용이 뒤섞여 있어 단순 벤치마크보다 훨씬 복잡한 의사결정을 요구한다. 다만 이 프로젝트는 얼마나 잘 해내는지보다 왜 그렇게 움직였는지를 보여주는 쪽에 무게를 둔 것으로 보인다.
원문에는 게임 속 오박사에 빗댄 문구가 하나 등장한다. JEV는 다음에 어디로 가야 하는지 가이드 덕분에 알았다는 내용이다. 이는 이 에이전트가 게임을 스스로 이해해서가 아니라 공략을 참조해 진행한다는 전제를 드러낸다. 자율적으로 환경을 탐색하는 에이전트와, 검색·참조에 기대는 에이전트 사이의 차이를 다시 생각하게 하는 대목이다.
개발자 입장에서 볼 만한 지점은 결정과 확률을 UI로 노출하는 방식 자체다. 에이전트를 제품에 넣을 때 사용자에게 다음 단계를 제시하고, 그 근거를 함께 보여주는 패턴과 맞닿아 있다. 원문 하단에 붙은 스폰서 메시지도 같은 맥락으로, 제품을 스스로 학습해 각 사용자에게 다음 단계를 앱 안에서 안내하는 AI 어시스턴트를 내세우고 있다.
한계도 분명하다. 원문은 짧은 소개 문구 수준이라 어떤 모델을 쓰는지, 실제 성능이 어느 정도인지, 코드가 공개됐는지는 밝히지 않는다. 데모의 재미와 실제 플레이 능력은 별개일 수 있고, 가이드 의존이라는 전제가 깔려 있으므로 '스스로 게임을 푼다'는 식으로 해석하기는 어렵다.
관련 글
- LLM 로그확률로 이미지까지 분류하는 Jev 스타일 래퍼 공개LLM이 내놓는 토큰 로그확률을 읽어 분류기처럼 활용하는 Jev 스타일 요청 형식이 공개됐다. 여기에 이미지 첨부 필드를 더해 웹캠 프레임을 실시간으로 판정하는 파이썬 예제까지 함께 올라왔으며, RTX 3090에서 초당 1프레임 수준의 처리량을 기록했다.
- Jev에게 '다음 글자'만 물어 챗봇으로 만든 실험, jevchat 공개결정 모델 Jev에게 매 단계 다음 기호를 묻고 확률 분포에서 샘플링해 문장을 만들어내는 실험 도구 jevchat이 공개됐다. 여러 샘플링 전략과 알파벳, 빔 탐색을 지원하며 오프라인 테스트 158개를 갖췄지만 비용은 비현실적이고 결과는 재미를 위한 것이다.
- 결정 전용 모델 'Jev' 활용 사례 20여 개 모은 사이트 공개중국 개발자 커뮤니티 V2EX에 결정 특화 모델 Jev를 활용한 프로젝트 20여 개를 모은 사이트가 공개됐다. 생성형 모델과 달리 분류·라우팅·점수화 같은 판단 작업을 전담하는 Jev의 실제 쓰임새를 사례로 보여준다.
- Jev와 Decitron은 둘 다 결정 AI지만 같은 게 아니다TypeSafe AI의 Jev는 지금 무엇을 고를지 즉시 판단하는 결정 AI다. Zhongke Wenge의 Decitron은 세계 모델과 다중 에이전트 시뮬레이션으로 미래 경로를 비교하는 결정 AI다. 둘 다 AI 출력을 텍스트에서 판단·행동으로 옮기려 하지만, 다루는 불확실성의 종류가 다르다.
- 텍스트 생성 없이 확률만 뽑는 결정 모델, 오픈소스로 33ms에 응답하다오픈소스 연구자가 텍스트를 생성하지 않고 확률만 즉시 내놓는 비자기회귀 결정 모델 'RL Agent'를 공개했다. 421M 파라미터 양방향 인코더 기반으로 GPU에서 33~38ms에 응답하며, 유사 개념을 상용화한 TypeSafe AI의 Jev보다 약 4배 빠르다고 주장한다.