VISTA는 무손실 시각 기억으로 멀티모달 에이전트의 장기 추론을 살린다

VISTA: A Visual Harness for Reasoning in an Interactive World

arXiv2610.02200v1

Qiushi Han2026-10-01조회 6

무엇인가

이 논문이 다루는 문제는 멀티모달 모델이 낯선 상호작용 환경에서 규칙과 목표를 스스로 알아내고 장기간 행동할 수 있는가다. 실험 무대는 ARC-AGI-3로, 규칙이 명시되지 않은 인터랙티브 시각 게임 25개(공개분)로 구성된다. 기존 접근은 대부분 이 벤치마크를 언어 문제로 취급해 환경을 텍스트나 기호 그리드로 표현하고, 실행·검증 가능한 프로그램으로 세계 모델을 합성하는 방식이었다. 저자들은 이를 시각 문제로 재정의하고, 기존 비전-언어 모델이 이미지를 한 번 인코딩한 뒤 그 표현에 의존하거나 문맥 한계 때문에 과거 관찰을 요약·삭제하는 구조가 장기 상호작용에서 추론을 제약한다고 지적한다.

어떻게 동작하나

제안 방법 VISTA는 학습된 모델이 전혀 들어가지 않는 기계적 하네스다. 세 가지 요소로 구성된다. 첫째, 시각 관찰은 환경이 렌더링한 이미지를 그대로 모델에 준다. 둘째, 무손실 시각 기억은 환경이 반환한 모든 프레임을 중간 애니메이션 프레임까지 포함해 원본 형태로 저장하고, 각 프레임을 턴 번호와 프레임 번호로 색인한다. 셋째, 시각 검사는 모델이 스스로 호출하는 도구로, 공간적으로는 임의의 직사각형 영역을 확대해 세부를 보고, 시간적으로는 임의의 과거 턴에서 여러 프레임을 불러와 상태를 비교하거나 행동이 전개된 과정을 재생한다. 여기에 선택한 영역의 RGB 값을 숫자로 읽는 read_pixels가 더해진다. 이는 상호작용 이력에 대한 명시적 어텐션 메커니즘으로 볼 수 있다.

무엇과 다른가

파이프라인은 모델과 하네스의 멀티턴 대화다. 한 게임 턴 안에서도 모델은 행동 하나를 실행하기 전에 여러 번 하네스와 주고받을 수 있다. 모델은 자유 형식 언어로 추론하고, GUIDE.md(레벨을 넘어 유지할 게임 이해)와 WORKING.md(현재 상태용 스크래치패드) 두 노트를 스스로 관리하며, 다음 행동의 결과를 예측한 뒤 play로 행동을 실행한다. 문맥이 한계에 가까워지면 간결한 인계 요약을 남기고 새 문맥에서 재개하는데, 노트와 시각 기억, 행동 이력은 그대로 유지된다. 모든 게임이 동일한 인터페이스와 짧은 프롬프트를 쓴다.

어떻게 쓰나

ARC-AGI-3 결과는 다음과 같다. Claude Opus 5.0(xhigh 추론 노력)에서 VISTA는 RHAE 100.00으로 25개 게임을 전부 완료했고, 총 7,302 행동을 사용해 사람 기준 17,135보다 57.4% 적었다. GPT-5.6 Sol(max)에서도 25개를 모두 완료하며 RHAE 99.00을 기록했다. 같은 모델의 공식 베이스라인은 각각 40.68과 13.33이다. 저자들 표현대로 프로그램 합성 없이 완전 또는 준완전 성능에 도달한 첫 시각 기반 시스템이다.

전제와 한계

절제 실험은 GPT-5.6 Sol max, 200K 토큰 문맥, 64×64 공식 프레임을 8배 최근접 업스케일한 512×512 PNG를 기본값으로 한다. 공식 구현(텍스트 그리드) 13.33, 10,619 행동에서 이미지 관찰로 바꾸면 47.32, 행동·시간 제한을 늘리면 51.66, 연속 대화와 네이티브 컴팩션을 쓰는 최소 하네스를 더하면 65.82, GUIDE.md와 WORKING.md를 추가하면 70.05, 무손실 시각 기억과 모델 주도 검사를 넣으면 94.10, 픽셀 값 읽기를 더하면 99.00이 됐다. 텍스트 그리드는 성능은 비슷하지만 행동 수가 약간 늘고 토큰은 훨씬 많이 든다. 64×64 그리드가 약 4,000 토큰인 반면 512×512 이미지는 약 308 토큰이며, 게임당 토큰 사용량은 71.9M 대 30.7M이다. 문맥 크기는 200K가 99.00으로 가장 좋았고 780K는 게임당 105.7M 토큰을 쓰면서 이득이 없었으며, 100K로 줄이면 RHAE가 0.4만 떨어지고 토큰은 절반가량이 된다. 입력 이미지 배율은 2·4·8·16배가 각각 128·256·512·1,024 픽셀과 프레임당 약 20·77·308·1,229 이미지 토큰에 대응하는데, 4배는 기본 8배보다 이미지 토큰을 75% 덜 쓰고 성능은 비슷했고 2배는 성능이 떨어지고 16배는 이득이 없었다. 오픈웨이트 백엔드 GLM-5.3 Flash 320B로도 RHAE 66.93을 내 공식 베이스라인을 크게 앞섰고, 같은 게임을 3D로 렌더링한 조건에서도 20,640 행동으로 RHAE 84.12를 기록했다.

일반 환경 확장성도 확인한다. GameWorld의 브라우저 게임 34개·170 태스크, AI GameStore의 공개 게임 10개, 정적 시각 추론 벤치마크 BabyVision의 시각 추적 하위 유형 39문항(미로 20, 선 잇기 19)에 같은 하네스를 거의 수정 없이 적용했다. 세 벤치마크 모두 최소 하네스를 쓴 동일 모델 베이스라인을 앞섰고, GameWorld와 AI GameStore에서는 사람 신규 플레이어 및 사람 중앙값 기준을 넘었다. 상호작용 이력이 없는 BabyVision에서도 정확도가 공식 구현 41.0%에서 63.2%로 올라, 단일 이미지 안에서 영역을 골라 들여다보는 검사 기능 자체의 효용을 보여준다.

개발자 관점에서 이 논문의 핵심은 모델을 바꾸지 않고도 인터페이스 설계만으로 성능이 크게 달라진다는 점이다. 스크린샷을 요약 텍스트로 압축해 문맥에 밀어 넣는 대신, 원본 프레임을 디스크나 외부 저장소에 색인해 두고 에이전트가 필요할 때 확대·재조회하도록 도구를 노출하는 패턴은 GUI 자동화, 브라우저 에이전트, 게임 봇에 그대로 적용 가능하다. 다만 도구 호출 횟수가 늘어 지연과 비용이 커질 수 있으므로, 문맥 크기와 이미지 배율을 워크로드에 맞게 조정해야 한다. 이 논문의 절제 실험은 100K 문맥과 4배 배율이 비용 대비 효율이 좋다는 실무적 힌트를 준다.

저자들이 밝힌 한계도 분명하다. 이 성과에는 기존 모델 자체의 능력이 결정적 요인이며 VISTA는それを 끌어내는 단순하고 효과적인 방법이라는 입장이다. 또한 사용한 모델들이 공개 벤치마크 이후에 출시되어 해당 게임들이 학습 데이터에 포함됐을 가능성을 배제할 수 없다고 명시하며, ARC-AGI-3의 비공개 세트 같은 새로운 게임에서의 평가가 더 강한 일반화 검증이 될 것이라고 말한다. 향후 과제로 물리 세계에 더 가까운 구현 환경 같은 복잡하고 현실적인 태스크로 확장을 제안한다.