옴니모달 에이전트의 병목은 계획이다, 증거 원장으로 잡는다

Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents

HF Daily2607.11433

Ming Ma, Yi Zhu, Yiran Zhong2026-09-24조회 5

무엇인가

옴니모달 에이전트는 비디오·오디오·웹페이지·계산 도구를 오가며 근거를 모아 질문에 답한다. 이 논문이 지목하는 병목은 지각이 아니라 계획이다. 브라우저가 반환하는 페이지 전문, 비디오 지각이 뱉는 장황한 설명 같은 잡음이 대화 이력에 쌓이면 멀티모달 모델의 계획이 직접적으로 흔들리고, 모델은 핵심을 추출하지 못한 채 성급히 결론을 내리거나 근거 없는 행동을 한다. 저자들은 백엔드를 하나씩 교체하는 통제 실험으로 이 진단을 뒷받침한다. 계획기를 바꿨을 때의 성능 손실이 지각 백엔드를 바꿨을 때보다 훨씬 크다는 것이다.

어떻게 동작하나

제안 시스템 Omni-Decision의 핵심은 대화 이력을 명시적 증거 원장(evidence ledger)으로 대체하는 것이다. 과제마다 질의를 열린 증거 필요 목록으로 파싱해 원장을 초기화하고, t 시점의 원장 상태는 S_t = {U_t, F_t, E_t, C_t}로 정의된다. U_t는 아직 해결되지 않은 필요, F_t는 사실 슬롯과 계산 결과, E_t는 출처와 시점 정보가 붙은 확정 증거 원자, C_t는 아직 조정되지 않은 관측 간 모순이다. E와 C는 비어 있는 상태로 시작하고, 관측이 커밋되면 필요가 U_t에서 빠지고 검증된 값이 F_t를 채우며 근거 원자가 E_t에 쌓인다.

무엇과 다른가

관측이 원장에 직접 기록되지는 않는다. 도구가 관측 o_t를 반환하면 비평자(critic)가 이를 현재 증거 필요와 대조해 지지·모순·누락 여부를 판정한 임시 호출을 수행하고, 그 판정 v_t를 거친 내용만 원장에 들어간다. 원장의 유일한 기록자는 리듀서이며, S_{t+1} = S_t ⊕ ΔS_t 형태의 결정론적 갱신으로 필드별 업데이트를 적용한다. 도구와 LLM 출력이 확률적이어도 원장 갱신 규칙은 결정론적이고, 어떤 모듈도 리듀서를 우회해 원장을 직접 수정할 수 없다. 계획기의 지속 컨텍스트에는 불변 과제 맥락 R_0, 경계가 정해진 텍스트로 렌더링된 원장 상태, 그리고 검토 중인 현재 관측 하나만 들어가므로 잡음이 누적되지 않는다.

어떻게 쓰나

답변 준비 여부도 원장이 결정한다. ready(S_t) = (U^b_t = ∅) ∧ complete(F_t) ∧ (C_t = ∅), 즉 차단성 필요가 남아 있지 않고 질의가 함의한 모든 사실·계산 슬롯이 검증된 값을 가지며 미해결 모순이 없어야 한다. 모순은 새 증거로 해소될 때까지 C_t에 남아 답변을 막고, 반복 시도로도 닫히지 않는 필요는 채울 수 없음으로 표시해 종료 처리한다. 계획기가 finish를 선택하면 파이널라이저가 원장에 대조해 답변을 검증하고, 실패하면 누락·모순 진단이 원장에 이벤트로 기록돼 다음 계획 단계로 넘어간다. 원장은 정지 시점도 정한다. 남은 예산에서 열린 필요·빈 슬롯·미해결 모순을 건드릴 만한 행동이 없으면 시스템은 근거 불충분을 보고하고 종료한다.

전제와 한계

실험은 OmniGAIA 360문항(비디오·오디오·이미지·웹·계산)과 장영상 벤치마크 WorldSense에서 이뤄졌다. OmniGAIA 전체 정확도 81.39%로 벤치마크 최고 기록이며, 같은 평가 창·같은 판정기로 측정한 Gemini-3.1-Pro의 79.44%보다 1.95포인트 높다. 공개 보고된 가장 강한 에이전트 시스템인 샌드박스 코딩 에이전트(75.00%)보다 전체 6.4포인트, 가장 어려운 Hard에서 7.7포인트 높다. 같은 백엔드 조합으로 돌린 Minimal agent, OmniGAIA 공식 베이스라인, OmniAgent는 모두 26% 미만이었다. 비용은 질문당 평균 약 1.2달러로 Gemini-3.1-Pro의 약 2.8달러의 약 43% 수준이다. WorldSense에서는 65.0%로 Gemini-3.1-Pro의 65.5%와 대등하면서 질문당 약 0.3달러를 썼다(같은 모델 직접 응답은 약 0.8달러).

백엔드 민감도 실험은 논문의 진단을 수치로 보여준다. 지각을 Gemini-3.1-Pro로 고정하고 계획기를 GPT-5.2에서 GLM-5.2, Qwen3.5-Plus, Qwen3.5-27B로 내리면 정확도가 81.39%에서 46.94%까지 단계적으로 떨어지고 Qwen3-Omni-30B는 14.72%까지 내려간다. 반대로 계획기를 GPT-5.2로 고정하면 지각을 세 가지로 교체해도 모두 58.89% 이상을 유지한다. 같은 Qwen3.5 세대의 Plus 티어끼리 비교하면 계획기 교체가 23.3포인트, 지각 교체가 15.8포인트로 약 1.5배 차이다. 둘 다 교체하면 13.89%로 계획기만 교체한 14.72%와 거의 같아, 계획기가 충분히 약해지면 지각 품질은 결과에 영향을 주지 못한다. 원장 자체의 기여를 보는 절제 실험에서도 원장 없는 ReAct와 롤링 자연어 요약 메모리를 모든 분할에서 앞섰고, Medium·Hard에서 약 24포인트 이득으로 Easy의 약 16포인트보다 컸다.

학습 레시피는 단계별 수동 주석이 필요 없다. 실행 중 기록된 원장 상태·행동·판정 궤적을 두 단계 신호로 쓴다. State-SFT는 판정기가 정답으로 표시한 실행을 골라 각 단계를 원장 상태와 계획 행동 쌍으로 확장해 계획기를 미세조정한다. 이어지는 closure-aligned 강화학습은 약한 계획기의 대표적 실패(필요가 열려 있는데도 포기하거나 조기 수렴)를 겨냥해, 정답 궤적에서 재구성한 원장 상태마다 후보 결정 그룹을 샘플링하고 규칙 기반 폐쇄 검사와 경량 보상 판정기로 그룹 평균을 넘는 결정을 강화한다. 원장이 열린 필요를 명시하므로 결정 하나를 실행 없이 채점할 수 있어 시스템 롤아웃이 필요 없다. Qwen3.5-27B는 46.94%에서 50.56%로, Qwen3-Omni-30B는 State-SFT만으로 14.72%에서 18.61%로 올랐다.

개발자 관점에서 이 논문이 주는 실무적 시사점은 명확하다. 같은 모델·같은 지각 백엔드를 쓰더라도 하네스에 따라 OmniGAIA 정확도가 5.56%에서 81.39%까지 벌어졌다는 점, 그리고 계획기 교체 비용이 지각 교체 비용보다 크다는 점은 에이전트를 만들 때 모델 선택보다 상태 표현과 검증 경계 설계를 먼저 봐야 한다는 뜻이다. 특히 관측을 지속 컨텍스트에 그대로 쌓지 않고, 별도 비평자 판정을 거쳐 타입이 있는 상태로만 커밋하며, 단일 리듀서가 유일한 기록자가 되게 만드는 패턴은 모델 교체 없이 이식 가능한 구조다. 남은 오류 감사에서도 원장과 최강 계획기를 갖춘 뒤에는 실패가 미디어 지각과 외부 검색에 약 4분의 3이 몰리고 조기 정지 같은 결정층 실패는 작은 비중이었다.

저자들이 밝힌 한계는 두 가지다. 첫째, 비평자가 관측을 텍스트 형태로만 읽고 미디어가 비평자 입력에 들어가지 않으므로 원장 품질이 지각 도구의 텍스트 출력에 의해 상한이 정해진다. 멀티모달 입력을 직접 읽는 비평자가 자연스러운 다음 단계라고 밝힌다. 둘째, 원장은 과제 범위(task-scoped)로 한정되며 현재 질의를 닫는 데 필요한 증거만 유지하고, 장기 메모리의 개방형 조직화까지 확장하지는 않는다.