ReImaGin은 이미지 생성 모델을 시각 추론 도구로 쓴다

Reasoning with Image Generation

HF Daily2609.16409

Nishad Singhi, Hector Garcia Rodriguez, Aditya Arora2026-09-14조회 4

무엇인가

체인오브소트(CoT) 추론은 LLM이 답을 내기 전에 중간 단계를 생성하도록 만들어 자연어 처리에서 큰 성과를 냈지만, 추론을 텍스트 영역에 가둬 두면 시각 표현을 직접 조작해야 하는 과제에서는 한계가 드러난다. 최근 멀티모달 LLM에 깊이 추정이나 객체 검출 같은 외부 시각 전문 도구를 붙이는 시도가 있었으나, 이런 도구는 미리 정해진 좁고 경직된 연산만 수행할 뿐 시각적 내용을 유연하게 생성하거나 변환하지는 못한다. 게다가 모델에게 도구 사용법을 가르치려면 손으로 만든 인컨텍스트 예시가 필요해 과제마다 사람의 노동이 들어가고 새 과제로의 일반화가 막힌다.

어떻게 동작하나

이 논문이 제안하는 ReImaGin은 이미지 생성 모델 자체를 유연한 시각 추론 기제로 쓰는 멀티모달 에이전트다. ReAct 프레임워크 위에 만들어졌으며, 에이전트는 자연어 질의 Q와 입력 이미지 집합 V, 그리고 이전 턴들의 이력 h_i = (사고 θ_i, 실행 동작 α_i, 실행 출력 o_i)로 구성된 컨텍스트 C_t를 유지한다. 매 턴마다 MLLM은 컨텍스트를 받아 다음 행동을 해석하는 사고 θ_t를 만들고, 이를 바탕으로 파이썬 프로그램 α_t를 내놓는다. 이 프로그램은 크롭·오버레이·차분 같은 결정적 이미지 유틸리티와 numpy 수준 픽셀 분석을 호출할 수 있고, 무엇보다 자유 형식 generate_image 도구를 부를 수 있다. generate_image는 텍스트 프롬프트와 선택적 참조 이미지를 받아 명령을 따르는 이미지 생성 모델로 새 이미지를 합성해 돌려주며, 그 결과가 다음 턴의 컨텍스트에 그대로 편입된다. 예컨대 충돌 예측 과제에서 에이전트는 움직이는 물체 앞에서 궤적선을 그리도록 generate_image를 호출하고, 생성된 이미지를 보고 그 선이 어떤 물체와 먼저 교차하는지 판별한다. 사고에 Terminate가 붙으면 루프가 끝나고 직전 텍스트에서 최종 답이 파싱된다.

무엇과 다른가

여기에 두 가지 장치가 더 붙는다. 첫째는 테스트타임 스케일링이다. 이미지 생성은 확률적이고 과제가 어려울수록 분산이 커진다. 가림 제거처럼 단순한 편집은 샘플마다 일관되지만 도면 생성처럼 어려운 변환은 배치가 크게 달라진다. 그래서 generate_image가 N개 후보를 독립적으로 샘플링하고 MLLM이 프롬프트를 가장 충실히 만족한 하나를 고르게 한다. 에이전트 입장에서는 항상 이미지 하나를 돌려받는 것처럼 보인다. 기존 테스트타임 스케일링이 텍스트 CoT 궤적을 여러 개 뽑아 다수결로 합치는 것과 달리, 여기서는 추론 궤적은 하나만 두고 추가 연산을 생성 이미지 품질에 쓴다. 둘째는 시각 추론 전략의 자동 탐색이다. 어떤 시각 변환이 도움이 되는지는 프롬프트로 전달되므로, 전략 탐색은 곧 프롬프트 최적화 문제가 된다. 제안 모델이 후보 프롬프트를 만들고, 소규모 개발셋에서 평가한 뒤 성공·실패 궤적을 보고 개선하는 반복 루프를 돈다. 학습 50개·개발 50개, 4라운드, 라운드당 후보 5개, 상위 2개 프롬프트 유지, 과제당 약 214달러 비용이 들었고 Opik으로 구현했다.

어떻게 쓰나

실험은 공간 이해와 시각 변환이 필요한 여섯 과제에서 이뤄졌다. 상대 깊이 지각(BLINK), 조각이 빠진 퍼즐 맞추기(MIRA), 검은 사각형에 가려진 물체까지 세는 가림 세기(CAPTURE), 조감 장면에서 충돌 대상 예측(Spatial457), 두 개의 부분 중첩 실내 뷰를 다루는 공간 추론(MMSI의 Pos(Obj-Obj)·Pos(Obj-Reg)), 그리고 논문이 새로 제안한 경로 추적(1~4 숫자와 A~D 문자가 점선으로 연결된 이미지에서 대응 관계 찾기)이다. MLLM 백본은 Gemini-3.1-Pro, GPT-5, Qwen-3.5-27B를, 이미지 생성 도구는 Nano-Banana-Pro를 주로 쓰고 FLUX.2 [dev]와 Qwen-Image-Edit-2511도 비교했다. 베이스라인은 도구 없이 답하는 No Tools와 고정 전문 도구 상자를 붙인 Visual Sketchpad다. 지표는 대부분 다지선다 정확도이고 가림 세기만 sMAPE를 쓰며, 3개 시드 평균과 표준오차를 보고한다.

전제와 한계

결과는 대부분의 과제에서 ReImaGin이 두 베이스라인을 앞섰다. 퍼즐 맞추기, 가림 세기, 경로 추적처럼 생성 능력이 필요한 과제에서 Visual Sketchpad는 No Tools보다 나아지지 못하거나 오히려 나빠졌다. GPT-5에서 퍼즐 맞추기는 Sketchpad 16.7% 대 No Tools 29.5%였다. 개선폭은 경로 추적에서 최대 25%, 가림 세기에서 상대 40%에 이른다. 예외는 Gemini-3.1-Pro의 깊이 추론으로, ReImaGin이 94.6%로 No Tools 91.7%는 넘었지만 전용 깊이 추정기를 가진 Sketchpad 99.2%에는 못 미쳤다. 공간 추론(MMSI)에서는 테스트타임 스케일링이 결정적이었다. 적용 전에는 Gemini 51.0%, Qwen 42.0%였으나 N=10 샘플링 후 59.0%, 54.3%로 올랐고, 동일한 테스트타임 예산을 받은 베이스라인(57.0%, 46.7%)도 앞섰다. 나머지 다섯 과제는 샘플 간 분산이 작아 테스트타임 스케일링을 적용하지 않았다.

오픈웨이트 이미지 생성 모델도 실험했다. FLUX.2 [dev]와 Qwen-Image-Edit-2511은 일부 과제에서 Nano-Banana-Pro와 비슷했지만 일관되지는 않았다. FLUX.2는 깊이 추정에서 도구 없음보다도 낮은 89.1%(No Tools 91.7%)를 기록했고, Qwen-Image-Edit은 경로 추적에서 76.0%로 Nano-Banana-Pro의 89.0%에 크게 뒤졌다. 반면 인페인팅처럼 단순한 조작에서는 가림 세기 sMAPE가 FLUX.2 7.0%, Qwen 6.8%, Nano-Banana-Pro 7.1%로 비슷했다. 비용은 MLLM 추론이 인스턴스당 0.04달러로 Sketchpad와 같고, 이미지 생성에 0.12달러가 추가된다. 실패 모드 감사에서는 여섯 과제에서 무작위로 뽑은 생성 이미지 120장 중 75%가 충실했고, 생성 이미지가 충실할 때 최종 답이 맞을 확률은 87%, 아닐 때는 43%였다. 오류는 생성 실패(도면이 물체 위치를 잘못 배치하는 등)와 MLLM 실패(충실한 시각화를 잘못 읽는 경우)로 나뉘며, 전자는 생성기 성능에, 후자는 MLLM 성능에 비례해 줄어든다.

전략 자동 탐색도 효과를 냈다. Gemini-3.1-Pro 조합에서는 다섯 과제 모두에서 No Tools를 앞섰고 전략 없는 상태(No Strategy)도 일관되게 이겼으며, Qwen-3.5-27B 조합에서는 다섯 중 네 과제에서 이겼다(MMSI는 동점). 발견된 전략은 사람이 설계한 것과 자주 닮았다. 깊이 프롬프트는 깊이 맵을 생성하는 법을, 충돌 프롬프트는 물체 앞에서 화살표를 그리는 법을 스스로 학습했다. 경로 추적에서는 사람이 점선을 실선으로 바꾸는 데 그친 반면 최적화된 전략이 색까지 칠했는데, Nano-Banana-Pro가 색칠은 자주 틀려 성능이 오히려 조금 떨어졌다. Gemini로 발견한 프롬프트를 수정 없이 Qwen에 옮긴 전이 실험에서도 다섯 과제 모두 No Tools를 앞섰고 충돌·공간 추론·경로 추적에서는 Sketchpad와 No Strategy도 이겼지만, 가림 세기에서는 성능이 떨어지고 깊이에서는 개선이 없었다.

개발자 관점에서 이 논문의 실용적 메시지는 명확하다. 과제마다 전용 시각 모듈을 붙이고 그 사용법을 예시로 가르치는 대신, 자연어를 따르는 이미지 생성 모델 하나를 도구로 노출하고 에이전트가 파이썬 코드로 호출하게 하는 편이 더 넓은 변환을 커버한다는 것이다. 다만 도입 전에 확인할 것이 있다. 생성 이미지의 충실도가 곧 정답률로 이어지므로(충실 87% 대 비충실 43%) 후보를 여러 장 뽑아 고르는 선택기와 검증 절차가 사실상 필수이고, 이는 인스턴스당 이미지 생성 비용 0.12달러를 전제로 한다. 또 전역적으로 일관된 공간 시각화가 필요한 과제는 여전히 강한 이미지 모델에 의존하며, 오픈웨이트 생성기는 국소 편집 수준에서는 경쟁력이 있지만 정밀한 공간 변환에서는 격차가 남는다. 저자들이 밝힌 한계도 같은 지점을 가리킨다. ReImaGin은 여전히 실수를 하며 특히 어려운 과제에서 취약하고, 생성 실패와 MLLM 실패가 각각 남아 있다. 전략 탐색은 과제당 약 214달러의 일회성 비용이 들고, MMSI의 복합 전략처럼 정교한 정책은 현재 탐색 설정으로 복원되지 않았다. 강한 MLLM에 맞춰 최적화한 전략을 약한 모델에 그대로 옮기면 이득이 줄어들 수 있다는 점도 전제로 남는다.