시각 생성 학습이 시각 이해를 돕는 조건을 19개 생성 과제로 밝힌다

OmniTaskonomy: When Does Visual Generation Improve Visual Understanding?

HF Daily2609.38079

Jiaxin Ge, Yiming Qin, Ji Xie2026-09-29조회 3

무엇인가

이 논문은 시각 생성 학습이 시각 이해를 실제로 개선하는지, 개선한다면 어떤 조건에서 그런지를 묻는다. 기존 연구는 이해가 생성을 돕는 방향을 주로 보였고, 일부는 생성이 이해에 주는 이득이 크지 않다는 입장을 취해 왔다. 저자들은 이 비대칭이 직관에 어긋난다고 지적한다. 생성은 객체 외양, 공간 관계, 기하 구조에 대해 픽셀 단위의 밀집 감독을 제공하는데, 이는 인식·계수·공간 추론·3D 지각 같은 이해 과제에도 필수적이기 때문이다. 연구는 생성과 이해가 한 모델 안에서 함께 학습되는 통합 멀티모달 모델(omni model)을 실험대로 삼고, Mixture-of-Transformers 구조의 BAGEL을 베이스라인으로 쓴다. 질문은 세 가지로 정리된다. 어떤 학습 커리큘럼이 생성에서 이해로의 전이를 가능하게 하는가, 어떤 생성 과제가 어떤 이해 능력에 도움이 되는가, 그라디언트 정렬이 성공적 전이의 신호가 되는가.

어떻게 동작하나

첫 번째 질문을 통제 실험으로 분리하기 위해 저자들은 같은 입력과 같은 시각 문제를 서로 다른 출력 모달리티로 표현하는 이미지 대 이미지(I2I) 생성 과제와 이미지 대 텍스트(I2T) 이해 과제 쌍을 만든다. VisGym에서 가져온 Jigsaw는 섞인 패치의 공간 배열을 복원하는 과제이고, Zoom-In은 서로 다른 배율의 뷰 순서를 복원하는 과제다. I2I 목적함수는 올바르게 정렬된 이미지를 생성하고, I2T 목적함수는 같은 순서를 텍스트 순열로 예측한다. 이 설정에서 여섯 가지 학습 레시피를 비교한다. I2T 단독, I2I 후 I2T, 혼합 후 I2T, 공유 파라미터를 동결한 I2I 후 혼합, 혼합 단독, I2I 후 혼합이다. I2T 예산을 1천 예제로 고정하고 I2I 데이터양을 늘려가며 측정한 결과, I2I 후 I2T와 I2I 후 혼합이 I2I 데이터가 늘수록 일관되게 성능이 올랐다. 두 레시피 모두 I2T와 공유되는 파라미터를 갱신하는 I2I 단독 단계로 시작한다. 반면 공유 가중치를 동결하거나 처음부터 두 목적함수를 섞으면 이득이 더 약하거나 불안정했다. 이후 실험의 기본 레시피는 I2I 후 I2T다.

무엇과 다른가

두 번째로 저자들은 I2I 감독이 I2T 데이터 수요를 얼마나 줄이는지 측정한다. I2I 예산을 10만 예제로 고정하고 I2T 예산을 1천, 3천, 1만, 3만 예제로 바꿔 I2I 후 I2T와 I2T 단독을 비교했다. I2I 학습은 네 예산 모두에서 성능을 끌어올렸고, I2T 예산이 작을수록 이득이 컸다. Zoom-In에서는 10만 I2I 예제 뒤에 1천 I2T 예제만 학습한 모델이 1만 I2T 예제로 단독 학습한 성능에 맞먹었다. Jigsaw에서는 10만 I2I 뒤 3천 I2T가 1만 I2T 단독과 비슷한 수준에 도달했다. 집계 수준을 넘어 개별 예제 수준의 대응도 확인된다. 3만 I2I와 1천 I2T로 학습한 세 개 시드의 최종 체크포인트에서, 같은 입력에 대한 I2I 예측이 맞은 경우 I2T 정확도가 더 높고 틀린 경우 더 낮았다.

어떻게 쓰나

세 번째 질문, 즉 어떤 생성 과제가 어떤 이해 능력으로 전이되는지를 다루려면 두 모달리티를 아우르는 공통 분류 체계가 필요하다. 저자들은 19개 I2I 과제와 25개 I2T 이해 능력을 하나의 능력 공간에 배치한 OmniTaskonomy를 제안한다. 최상위는 컴퓨터 비전의 세 가지 근본 문제인 인식(Recognition), 재구성(Reconstruction), 재조직(Reorganization)이다. 인식은 객체와 부분의 정체성, 외양, 상태, 활동, 텍스트와 기호를, 재구성은 공간 관계, 깊이, 미터법 거리, 방향, 3D 형상, 조명, 가림을, 재조직은 분할, 대응, 순서, 계수, 키포인트, 연결성을 포괄한다. 세부 능력은 위에서 정한 것이 아니라 BLINK, MMStar, MMT-Bench, CV-Bench, RealWorldQA, MMVP, VStarBench 일곱 개 벤치마크에서 상향식으로 도출한다. gemini-3-flash-preview로 각 문항이 요구하는 시각 속성과 관계를 기술하게 하고, 이를 고정된 속성 스키마로 정리한 뒤 10개 배치로 나눠 VLM이 로컬 과제 트리를 만들고, 배치 간 동의어 잎을 병합하고 수동 검토로 경계를 다듬는다. I2I 과제는 그 목적함수가 직접 감독하는 주된 시각 능력에 따라 같은 계층에 배치한다. 최종 주석은 VLM 심사자 3명이 독립적으로 달아 최소 2명이 일치한 9,444개 샘플만 남겼다. 인간 검증에서 확정 판단의 97.4%가 VLM 배정과 일치했고, 심사자별 Cohen's κ는 0.956~0.989(평균 0.972), 4명이 공통 검토한 50개 예제의 Krippendorff α는 0.943이었다.

전제와 한계

전이 실험은 같은 BAGEL 체크포인트에서 약 5만 개 I2I 예제를 학습한 뒤 5만 개 LLaVA-Instruct 예제로 이어 학습하는 방식으로, 19개 I2I 과제 각각에 대해 25개 이해 능력을 평가한다. 베이스라인은 I2T 데이터만 학습한 모델이고, 전이는 해당 능력 데이터셋에서의 정확도 차이(퍼센트 포인트)로 정의하며 예제별 정확도에 대한 정확 쌍 순열 검정으로 유의성을 본다(p<0.05). 결과는 균일하지 않다. 평가 예제가 100개를 넘는 19개 능력 가운데 5개만이 적어도 하나의 I2I 소스에서 유의하게 향상됐다. metric 3D relation과 counting은 12개 I2I 과제에서, 2D ordering은 11개 과제에서 이득을 봤다. 반대로 OCR, 텍스트 인식, 외양 이해 같은 능력은 어떤 소스에서도 향상되지 않았다. 가장 큰 향상은 counting에 대한 localization(+2.5pp)과 object pointing(+2.0pp), metric 3D relation에 대한 Euclidean depth(+3.8pp), Z-depth(+3.6pp), surface normals(+3.4pp), 2D ordering에 대한 Jigsaw(+6.8pp)였다. 직관적으로 대응되지 않는 전이도 있다. inpainting은 counting을 +1.5pp, 2D ordering을 +7.2pp 올렸고, 2.5D segmentation은 category recognition을 +1.2pp 개선했다.

저자들은 이 차이가 두 목적함수의 최적화 신호 호환성에서 비롯된다고 가정하고 그라디언트 정렬을 측정한다. 사전학습 체크포인트에서 각 파라미터 블록에 대한 I2I와 I2T 그라디언트를 정규화하고, 두 분포에 공통인 비중심 PCA 기저를 고유값 합의 99%를 덮는 최소 성분 수만큼 잡아 부분공간에서 코사인 유사도를 계산한 뒤 추정 유효 차원의 제곱근을 곱해 블록 간 비교가 가능하게 만든다. 통제된 Jigsaw와 Zoom-In 쌍에서 정렬은 이해 브랜치의 pre-attention RMSNorm 파라미터에서 가장 강했고, 특히 초기 트랜스포머 레이어에서 두드러졌다. 이어서 28개 레이어의 pre-attention RMSNorm 파라미터를 이어 붙여 19개 I2I 과제와 평가 예제 500개를 넘는 7개 이해 능력을 분석했다. 능력별로 19개 소스에 대해 평균낸 정렬과 평균 전이 이득은 강한 양의 상관(r=0.795)을 보였고, 19×7=133개 소스-타깃 쌍을 개별로 봐도 양의 상관(r=0.529)이 유지됐다. 저자들은 그라디언트 정렬을 생성에서 이해로의 전이와 연관된 최적화 수준의 신호로 규정한다.

실무적으로 이 논문이 주는 지침은 세 가지다. 생성 학습을 이해 성능을 위한 초기화로 쓰고, 이해 데이터가 적을수록 생성 사전학습의 가치가 커지며, 생성 과제는 목적함수의 형태가 아니라 그것이 감독하는 시각 능력을 기준으로 골라야 한다는 것이다. 특히 I2T 파인튜닝 데이터가 1천~3천 수준으로 빠듯한 상황에서 10만 규모의 I2I 데이터를 먼저 학습하는 전략이 1만 규모 I2T 단독 학습에 맞먹는 결과를 냈다는 점은 데이터 예산 배분에 직접적인 참고가 된다. 다만 적용 범위는 좁다. 실험은 Mixture-of-Transformers 기반 BAGEL 한 아키텍처에서, 19개 I2I 과제와 25개 이해 능력, 9,444개 평가 샘플, 약 5만 I2I와 5만 I2T 예산이라는 고정된 조건에서 수행됐다. 전이 지도에서 유의하게 나타난 능력은 19개 중 5개뿐이므로 모든 이해 과제에 생성 학습이 듣는다고 일반화할 수 없다. 그라디언트 정렬은 전이와 상관이 있을 뿐 인과를 입증하지 않으며, 정렬 측정 자체도 사전학습 체크포인트 한 지점에서 계산된다. 결론에서도 저자들은 생성 목적함수를 자신이 지원하는 시각 능력에 맞춰 선택하고, 그 감독이 목표 이해 과제에 이득이 되도록 하는 학습 레시피와 함께 써야 한다는 조건부 권고로 마무리한다.