QuadTok이 쿼드트리로 이미지 토큰을 복잡도에 따라 배분한다
QuadTok: Quadtree Visual Tokenizer for Autoregressive Image Generation
무엇인가
이미지 생성용 토크나이저는 지금까지 두 갈래였다. 하나는 2차원 그리드에 고정 예산으로 토큰을 균일하게 뿌리는 방식이고, 다른 하나는 이미지를 1차원 시퀀스로 보고 길이를 유연하게 가져가는 방식이다. 문제는 자연 이미지의 정보 밀도가 균일하지 않다는 점이다. 질감이 복잡한 영역은 토큰이 모자라고, 매끈한 하늘·벽 같은 영역은 토큰이 남는다. 반대로 1차원 토크나이저는 유연하지만 토큰과 이미지 패치의 명시적 대응이 사라져 픽셀 수준 충실도와 위치 기반 다운스트림 작업에서 약해진다. QuadTok은 이 둘 사이를 쿼드트리로 잇는다.
어떻게 동작하나
QuadTok의 표현 단위는 쿼드트리 노드다. 각 노드는 레벨 l과 공간 인덱스 p의 튜플 (l,p)로 정의되고, 레벨 1은 거친 영역, 레벨 2는 그보다 고해상도 세분화를 뜻한다. 부모 노드는 자기 사분면을 덮는 자식 노드 네 개로 확장될 수 있다. 기본 설정은 2레벨이고 3레벨 확장도 실험한다. 이 계층 구조를 트랜스포머에 넣기 위해 BFS(너비 우선 탐색)로 1차원 시퀀스로 직렬화하는데, 거친 토큰이 먼저 나오고 세밀한 자식 토큰이 뒤따르므로 coarse-to-fine 생성 순서와 자연스럽게 맞는다. 인코딩은 ViT로 조밀한 패치 특징 F를 뽑고, 각 노드의 위치와 레벨을 담은 학습 가능한 instruction 토큰 Q를 F와 이어 붙여 Aggregator 트랜스포머에 통과시킨다. 각 노드 임베딩은 학습된 코드북으로 벡터 양자화되어 이산 토큰이 된다. 디코딩은 역방향으로, 레벨별 unpatching 연산자로 각 노드 특징을 공간 패치로 투영해 캔버스에 배치하고 레벨별로 학습된 업샘플링으로 누적한다.
무엇과 다른가
트리를 1차원으로 펼치면 계층 제약이 사라진다. 그래서 저자들은 Kinship Causal Mask를 도입한다. 두 레벨 기준 세 규칙이다. 부모 대 부모는 양방향으로 서로를 보고 전역 레이아웃을 세운다. 자식에서 부모로의 참조는 허용되지만 부모에서 자식으로는 막혀 거친 정보가 먼저 확정된다. 자식 대 형제는 같은 부모를 공유하는 자식끼리만 양방향으로 연결되어 세분화가 해당 공간 영역 안에 갇힌다. 더 깊은 트리로도 같은 규칙이 확장된다. 인코딩에서는 ViT 토큰끼리 양방향으로 보고, 쿼드트리 토큰이 ViT 토큰을 참조하는 비대칭 구조다. 또한 학습 시 완전히 확장된 고정 트리를 쓰면 모델이 결정적 레이아웃에 의존하게 되므로, 레벨 1 노드는 항상 유지하고 각 부모가 확률 γ로 독립적으로 네 자식으로 확장되는 확률적 트리 샘플링을 쓴다.
어떻게 쓰나
어느 영역을 세분화할지는 재구성 이득으로 정한다. 복잡한 영역은 세밀 토큰으로 재구성했을 때 지각적 충실도가 크게 오르고 균질한 영역은 그렇지 않다는 직관이다. 이를 효율적으로 추정하려고 probing 절차를 쓴다. 거친 영역의 절반을 무작위로 확장한 트리와 나머지 절반을 확장한 상보적 트리를 만들어 두 번 재구성하고, 각각 원본과의 LPIPS 손실 맵을 계산한다. 어떤 영역 r에 대해 붕괴 상태의 손실에서 확장 상태의 손실을 뺀 값을 그 영역 크기로 평균 낸 값이 재구성 이득 추정치가 된다. 이 값이 임계값 τ를 넘는 영역을 네 자식으로 확장하며, 기본값은 LPIPS 기반 τ=0.05다.
전제와 한계
생성은 생성 전에 주어진 토폴로지 T 위에서 이뤄진다. 조건 c(예: 클래스 레이블)와 각 노드의 트리 속성 t_i가 주어진 상태에서 BFS 순서로 토큰을 하나씩 예측하는 자기회귀 분해를 쓴다. 모델은 LLaMA 스타일 디코더 온리 트랜스포머이고 표준 인과 마스크를 쓴다. 토크나이저의 양방향 부모·형제 상호작용은 생성기에서 쓰지 않는다. 추론 시 거친 토큰이 먼저 전역 구조를 세우고, 이후 세밀 토큰이 국소 디테일을 다듬는다.
토크나이저는 ImageNet-1K 256×256으로 학습해 ImageNet 검증셋과 MS-COCO 검증셋에서 평가했고, COCO는 파인튜닝 없이 제로샷 전이했다. LlamaGen 다운샘플링 팩터 16과 비교해 콘텐츠 적응적 배분이 더 적은 토큰으로 더 낮은 rFID를 냈지만 PSNR은 낮아지는 트레이드오프가 있었고, COCO 제로샷에서도 같은 경향이 유지됐다. 구체적으로 ImageNet에서 평균 230토큰으로 rFID 1.46, PSNR 20.37을 기록해 고정 256토큰 그리드 대비 약 10% 토큰을 절약했고, COCO에서는 평균 232토큰으로 약 9%를 절약했다. 생성은 111M(B), 343M(L), 697M(XL), 947M(XXL) 2레벨 생성기 패밀리와 3레벨 344M 모델로 실험했고, 947M GPT 스타일 모델이 ImageNet 256×256에서 gFID 2.08을 기록해 1.4B RandAR-XXL의 2.15를 앞섰다. 3레벨 토크나이저는 기본 8×8에서 16×16으로 가는 계층에 32×32 토큰 그리드를 추가한 것으로, 두 데이터셋 모두에서 재구성이 개선됐다. 확장 확률을 키우면 gFID가 처음에는 좋아지다가 최대 확장에 이르기 전에 최적점을 지나 다시 나빠졌다.
어블레이션에서 Kinship Causal Mask를 빼면 토크나이저가 사실상 순차적 1D 코드로 퇴화한다. rFID는 1.46에서 1.41로 조금 좋아지지만 PSNR이 20.37에서 19.16으로 1점 넘게 떨어지고, 같은 697M 생성기와 CFG에서 gFID가 2.23에서 3.17로 악화됐다. 토큰 하나를 무작위 코드로 교란했을 때 마스크가 있으면 차이가 해당 패치에 국소화되고, 없으면 이미지 전체로 퍼진다. 트리 구성 비교에서는 완전 확장 트리가 320토큰으로 잘 복원되고, 비슷한 크기의 무작위 트리는 253토큰에서 rFID 1.60으로 더 나빴다. 복잡도 가이드를 적용한 QuadTok은 230토큰으로 rFID 1.46, PSNR 20.37로 완전 확장과 맞먹으면서 토큰을 28% 줄였다. 제로샷 공간 레이아웃 제어에서는 좌·우·상·하 네 개 반평면 목표에 대해 사용자가 지정한 레이아웃이 무작위 토폴로지 기준선보다 Grad-CAM, Grounding DINO, SAM 2 세 가지 위치 지표의 히트율을 모두 끌어올렸고, FID-50cls 변화는 −0.15에서 +0.12 포인트 범위였다.
실무적으로 QuadTok은 토큰 예산이 곧 추론 비용인 자기회귀 이미지 생성 파이프라인에서 의미가 있다. 같은 충실도에서 토큰을 10% 안팎 줄이면 시퀀스 길이가 줄고 지연도 줄어든다. 또 토폴로지를 생성 전에 주입할 수 있다는 점이 독특한데, 사용자나 LLM이 특정 영역을 지정하면 그 영역을 확장한 쿼드트리를 만들어 클래스 조건 생성만으로 피사체 위치를 유도할 수 있다. 다만 이 제어는 ImageNet 클래스 안에서만 검증됐고 별도 레이아웃 학습 없이 기존 생성기를 얼려 쓴 결과다. 저자들이 밝힌 한계는 명확하다. 이 작업은 클래스 조건부 생성에 초점을 맞췄고, 멀티모달 파이프라인과 텍스트-투-이미지 생성은 향후 과제로 남겼다. 또한 PSNR은 LlamaGen보다 낮아 픽셀 단위 정확도가 중요한 용도라면 rFID와 PSNR의 트레이드오프를 직접 확인해야 한다.