Omni-IO Skills가 기존 에이전트를 재학습 없이 옴니네이티브로 확장한다
Omni-IO Skills: Harnessing Your Agent Omni-Native
무엇인가
이 논문은 범용 에이전트가 텍스트·이미지·오디오·비디오·문서·3D·코드를 섞은 실제 작업을 끝까지 수행하지 못하는 문제를 다룬다. 온라인 강의 제작처럼 강의 녹음, 참고 문서, 콘텐츠 분석, 시각 디자인, 슬라이드, 삽화, 내레이션, 설명 영상이 한 흐름에 얽히는 작업에서는 산출물이 독립적이지 않고 사실·스타일·타이밍·제작 제약을 공유한다. 기존 옴니 파운데이션 모델은 모달리티를 늘릴수록 표현·목표·충실도 요구를 재조정해야 하고 새 데이터·코덱·디코더·정렬 단계가 필요해 비용이 모델 업데이트에 묶인다. 전문 모델과 도구를 조립하는 방식도 절차·의존성·중간 자산·턴 간 수정을 누가 어떻게 조정할지 남는다. 저자들은 이 빈틈을 옴니 에이전트 하네스로 규정하고, 기존 범용 에이전트의 추론·계획 코어를 바꾸지 않고 플러그앤플레이로 옴니네이티브하게 만들 수 있는지 묻는다.
어떻게 동작하나
제안하는 Omni-IO Skills는 호스트 에이전트와 외부 멀티모달 도구 사이에 놓이는 플러그앤플레이 하네스다. 역량은 로드 가능한 Skill로 실리고, Atomic·Expert·Scenario 세 계층으로 나뉜다. 현재 구현은 Atomic 19개, Expert 2개, Scenario 6개로 총 27개 Skill이며, 이해·생성·추론·검색 네 역량군, 7개 산출물 모달리티, 38개 대표 작업을 포괄한다. Atomic은 단일 호출 가능 연산, Expert는 하나의 최종 산출물을 위한 전문 제작 워크플로, Scenario는 교육·연구·마케팅·창작·소프트웨어 공학 같은 응용 맥락에서 여러 산출물을 조정한다. 모든 Skill은 적용 조건 c, 입력 I, 절차 P, 출력 O, 다른 Skill과의 관계 H를 갖는 선언적 표현 s=⟨c_s,I_s,P_s,O_s,H_s⟩로 정의되고, 상위 Skill은 실행 가능한 하위 Skill로 재귀적으로 확장된다.
무엇과 다른가
하부는 네 계층이다. Skill Entry는 호스트 에이전트에 통합 작업 인터페이스를 노출하고 Skill을 선택·확장한다. MCP Tool Service는 이해·생성·유틸리티 도구를 표준 계약으로 호출하며, 각 DEG 노드를 작업 유형, 자기완결 프롬프트, 선택 파라미터, 의존성이 해소된 자산 입력으로 제출한다. Provider and Configuration은 이미지 생성이나 음성 합성 같은 의미적 능력을 특정 제공자·모델·자격증명·기본 파라미터·폴백 정책에 바인딩한다. Asset Registry는 사용자 제공·중간·최종 산출물을 asset_id, type, subtype, path, description, params, turn_id, source_asset_id로 정규화해 물리 경로와 분리하고, append-only JSON 레지스트리와 파일 잠금으로 병렬 노드·세션 간 덮어쓰기를 막는다.
어떻게 쓰나
실행은 Declare Execution Graph(DEG)로 표현된다. DEG G=(V,E)에서 노드는 v=⟨id,type,prompt,params,depends_on⟩이고, 간선은 제어 의존성과 데이터 의존성을 함께 나타낸다. 실행 전 그래프는 모든 의존성이 해소되는지, 비순환이지 검증되고 실패하면 계획 오류로 재구성된다. 유효한 DEG는 선행 노드가 끝난 노드들로 웨이브를 만들고 같은 웨이브의 독립 노드를 동시에 디스패치한다. 이미지와 오디오 생성은 서로 소비하지 않으면 병렬로 돌고, 이미지 조건 비디오는 참조 이미지를 기다린다. 노드 실패 시 대기 중인 하위 노드는 취소되지만 독립 분기는 계속 실행되고, 완료된 노드 출력은 롤백하지 않는다. 예시로 제품 이미지에서 포스터·효과음 포함 프로모션 영상·랜딩 페이지를 만드는 요청은 제품 참조 분석, 두 병렬 자산 생성, 프로모션 콘텐츠 제작, 랜딩 페이지 생성의 네 웨이브로 스케줄된다. 이후 사용자가 랜딩 페이지 스타일만 바꾸면 등록된 제품 분석·프로모션 자산을 완료된 asset_source 노드로 재사용하고 랜딩 페이지 작업만 다시 실행한다.
전제와 한계
실험은 UniM에서 고정 선택한 90개 인스턴스 UniM-90으로 한다. 텍스트·이미지·오디오·비디오·문서·코드·3D와 대표적 인터리브 조합을 포함한다. 베이스라인은 GPT-5.6 Sol과 Claude Sonnet 5의 Base Agent 및 Agent+Omni-IO Skills 구성이다. 지표는 입력 지원률 τ, Semantic–Quality Coupled Score(SQCS)의 절대·상대 변형, Interleaved Coherence Score(ICS), Strict Structure Score(StS), Lenient Structure Score(LeS)다. 결과적으로 입력 지원률은 40.00%와 38.89%에서 둘 다 100%로 올랐다. 상대 SQCS는 26.99→74.94, 27.82→77.78로 각각 47.95, 49.96 포인트 증가했다. 절대 SQCS는 67.49와 71.53에서 74.94와 77.78로 올랐고, ICS는 34.61과 32.00에서 93.98과 83.28로 증가했다. StS는 100.00과 99.78, LeS는 두 호스트 모두 100.00이다. 저자들은 두 에이전트의 기본 능력이 다를 수 있어 에이전트 간 점수 차이를 모델 순위로 해석하지 않고, 하네스가 만든 에이전트 내부 개선에 초점을 둔다.
사례 연구로 미술 튜토리얼 생성과 제품 프로모션을 정성 분석한다. 미술 튜토리얼에서는 S4 Education Sharing Skill이 계획과 워크플로를 조정하고, A2 Video Understanding이 영상에서 드로잉 단계를 추출하며, A3 Audio Understanding이 설명과 절차 순서를 복원하고, A6 Image Generation이 11장 튜토리얼 이미지를 만든다. 제품 프로모션에서는 A1 Image Understanding이 제품 속성을 추출하고, E1 Poster Design이 포스터를, E2 Complex Video Production이 프로모션 영상을, A16 Code Generation이 랜딩 페이지를 만든다. 두 호스트 모두 요청된 출력을 모두 생성하면서 튜토리얼 단계, 제품 정체성, 산출물 간 일관성을 유지했다고 보고한다.
한국 개발자에게 이 논문은 에이전트에 멀티모달 실행 계층을 붙이는 설계 패턴을 제시한다. 호스트 모델을 재학습하거나 추론 코어를 바꾸지 않고도 MCP 도구, 제공자 바인딩, 자산 레지스트리를 통해 오디오·비디오·문서·3D·코드 작업을 연결할 수 있다는 주장이다. 실무에서는 Skill의 적용 조건과 입출력 계약, DEG의 의존성 검증·웨이브 스케줄링, 실패 시 하위 노드 취소와 독립 분기 지속, 턴 간 asset_ref 재사용, 제공자 교체와 폴백 정책을 확인해야 한다. 특히 산출물이 여러 개이고 서로 내용·스타일을 공유하는 제작 파이프라인에서 중간 자산을 한 번 등록해 재사용하는 구조가 유용하다.
원문은 별도의 한계 절을 두지 않는다. 다만 저자들이 명시한 전제는 평가가 UniM-90이라는 통제된 90개 인스턴스 부분집합과 GPT-5.6 Sol, Claude Sonnet 5 두 호스트에 한정된다는 점이다. 또한 입력은 처리할 수 있지만 필요한 출력 모달리티를 생성하지 못하거나 목표 출력을 완성하지 못한 실패도 지표 계산에 포함한다고 밝힌다. 하네스는 외부 전문 모델·미디어 엔진·MCP 도구를 교체 가능한 실행 백엔드로 전제하므로, 실제 성능과 비용은 연결한 제공자와 자격증명·기본 파라미터·폴백 정책에 좌우될 수 있다. 논문은 호스트 에이전트의 추론 코어를 바꾸지 않는 대신, 그 코어가 Skill 선택과 DEG 구성을 제대로 수행한다는 조건 위에서 성립한다.