중국어 글자 내부 구조를 분해해 보상하는 IDSpect가 텍스트 렌더링을 개선한다

Decompose Radicals, Then Reward: Fine-Grained Inspection for Accurate Chinese Text Rendering

HF Daily2609.37569

Yazhen Xie, Xingsong Ye, Zhineng Chen2026-09-29조회 1

무엇인가

텍스트-이미지 생성 모델에게 중국어 문장을 정확히 그리게 하는 일은 여전히 어렵다. 이 논문이 겨냥하는 핵심은 생성 자체보다 평가 방식이다. 기존 강화학습 보상은 OCR로 이미지를 문자 전사로 압축한 뒤 정답 문자열과 비교한다. 그런데 한자는 재사용 가능한 컴포넌트가 좌우·상하·포위 같은 명시적 공간 관계로 배열된 2차원 합성물인데, OCR 보상은 이를 원자적 문자 하나로 취급한다. 그래서 시각적으로 전혀 다른 라디칼 수준 오류가 똑같이 거친 피드백을 받고, 목표와 그저 닮은 글리프가 장려된다. 논문은 같은 이미지에서 두 가지 실패 모드를 지적한다. 전문 OCR은 국소 외형을 따라 그럴듯하지만 틀린 문자를 예측해 문자 단위 보상에 0.00을 기여하고, 전역 MLLM OCR은 망가진 구조에도 주변 언어 맥락으로 정답을 복원해 거짓 양성 1.00을 만든다. TextPecker는 이상 글리프를 #으로 대체해 거짓 양성은 피하지만 역시 0.00을 준다. 즉 어떤 글리프가 문제인지는 알려주지만, 그 내부 구조가 얼마나 맞는지는 세지 못한다.

어떻게 동작하나

제안 방법의 뼈대는 표의문자 기술 시퀀스(IDS)다. IDS는 한자를 계층 트리로 표현하며, 내부 노드는 공간 연산자, 리프 노드는 재사용 가능한 컴포넌트에 대응한다. 저자들은 Unicode 16.0 BabelStone 사전으로 GB 18030-2022가 포괄하는 한자를 재귀 분해하고, 재귀 깊이를 10으로 제한한 뒤 그 결과 나온 공간 연산자와 컴포넌트로 디코더 어휘를 만든다. 문자 c의 분해를 D(c)라 할 때 문자열 y의 목표 구조 표현은 D(y) = D(c1) ⊕ … ⊕ D(cM)처럼 각 문자의 IDS를 이어 붙여 얻는다. 이 표현 위에서 IDS 인식기 f_ids는 이미지를 먼저 문자열로 읽고 기호적으로 분해하는 대신, 렌더링된 텍스트 이미지에서 곧바로 IDS 시퀀스를 예측하도록 학습된다. 구조는 SVTRv2 비주얼 백본에 NRTR 스타일 Transformer 디코더를 붙여 IDS 어휘에 대한 자기회귀 예측으로 문자 전사를 재정식화한 것이다.

무엇과 다른가

인식기 학습 데이터 설계가 방법의 절반이다. 자연 장면 텍스트 말뭉치는 빈도 높은 문자에 강하게 편향돼 있어 라디칼 감독이 불균형해진다. 게다가 자연 분포에서는 인식기가 글리프를 흔한 문자로 먼저 알아본 뒤 그 문자의 정규 IDS를 그대로 뱉는 지름길을 쓸 수 있고, 그러면 IDS 예측이 사실상 문자 인식으로 퇴화해 내부 오류를 드러내지 못한다. 저자들은 UnionST 렌더링 엔진을 개조해 IDSynth-1M, 즉 100만 장의 렌더링 장면 텍스트 이미지 데이터셋을 만들고, 선택된 중국어 폰트가 커버하는 문자 집합에서 거의 균일하게 문자를 샘플링해 전사문을 구성한다. 이 샘플링은 자연스러운 어휘 공기까지 억제해 언어 맥락만으로 완전한 문자를 추론하기 어렵게 만들고, 결과적으로 시각 정보에서 IDS를 파싱하도록 유도한다. 최대 디코딩 IDS 길이는 100 토큰이다.

어떻게 쓰나

보상은 두 갈래다. OCR 검출기가 텍스트 크롭 {I_k}를 내놓고 IDS 인식기가 각 크롭에 대해 구조 토큰 시퀀스 ŝ_k를 만든다. 목표 IDS를 s = D(y)라 할 때, 검출기 순서대로 예측을 이어 붙이지 않고 각 ŝ_k를 s의 후보 span에 정렬한다. 후보 span은 준전역 편집 정렬로 생성하고 비최대 억제로 근접 중복을 제거하며, 전역 할당이 각 예측 크롭에 최대 하나의 목표 span을 배정하고 각 목표 위치는 정확 일치 크레딧을 딱 한 번만 받는다. 이렇게 하면 크롭 순서에 무관해지면서 크롭 내부의 IDS 토큰 순서는 보존된다. 조성 보상은 토큰 수준 F1으로, r_ids = 2C(A*) / (|D(y)| + Σ|ŝ_k|)다. 여기서 C(A*)는 유일하게 크레딧된 목표 IDS 토큰 수다. 개별 컴포넌트와 공간 연산자가 맞으면 원자적 OCR 출력이 그대로여도 점수가 오르고, 빠지거나 덧붙은 예측은 F1 분모와 유일 크레딧 제약으로 벌점을 받는다. 의미 보상 r_sem은 공백 제거·소문자화 후 정규화된 문자 편집 유사도로, 목표 문자열이 인식 결과에 부분 문자열로 나타나면 1, 아니면 1 − min{Lev, |ȳ|}/|ȳ|다. 최종 보상은 R = λ·r_sem + (1−λ)·r_ids이며 실험 전체에서 λ = 0.5로 동일 가중치를 준다. 두 보상 분기는 학습 후 버려지므로 생성기 추론 시 추가 비용이 없다.

전제와 한계

실험은 Qwen-Image를 Flow-GRPO로 후학습하되 Flow-Factory 기본 설정에 따라 LoRA 어댑터(rank 64, α 128)를 AdamW, 학습률 3×10⁻⁴, 가중치 감쇠 10⁻⁴로 최적화한다. 베이스라인은 동결 모델, OCR만 쓴 GRPO, TextPecker 보상 GRPO다. LongText-Bench와 GenTextEval-Bench에서 원 벤치마크 텍스트 점수(Avg.), 구조 품질(Qua.), 의미 정합성(Sem.)을 측정했다. LongText에서 동결 모델은 Avg. 0.920, Qua. 0.924, Sem. 0.834였고 OCR GRPO가 0.967, 0.956, 0.886으로 올렸으며, TextPecker 보상은 Avg. 0.974, Qua. 0.969, Sem. 0.908까지 갔다. IDSpect는 Qua. 0.975, Sem. 0.928로 가장 높으면서 Avg. 0.972로 TextPecker와 비슷한 수준을 유지했다. GenTextEval에서는 TextPecker가 Qua. 0.973, Sem. 0.897인 데 반해 IDSpect가 Qua. 0.979, Sem. 0.911을 기록했는데, 이는 OCR 보상을 각각 0.026, 0.037 앞선 것이고 TextPecker보다 0.006, 0.014 개선된 값이다. 정성적으로도 긴 간판·포스터 문장에서 구조 오류가 누적되는 구간의 개선이 두드러지고, 여러 텍스트 영역의 장면 레이아웃은 유지된다.

절제 실험은 보상 설계의 두 축을 분리한다. 먼저 IDS 기준을 무엇으로 두느냐다. 각 크롭에서 인식된 OCR 전사의 IDS를 기준으로 삼는 per-crop consistency는 Qua. 0.980으로 가장 높았지만 Sem. 0.901로 목표 기반 크롭 정렬의 0.911보다 낮았다. OCR 예측과 구조적으로 일관되는 것이 요청된 텍스트와의 정합을 보장하지는 않는다는 뜻이다. 다음은 정렬 전략 비교다. 검출기 순서대로 이어 붙이는 직접 연결은 순서 불일치에 취약하고, TextPecker의 문자 단위 매칭은 크롭 순서 의존성은 줄이지만 문자를 독립적으로 다뤄 문자 간 순서 정보를 버린다. 크롭 단위 정렬은 Sem. 0.911로 직접 연결과 문자 단위 매칭을 각각 0.025, 0.012 앞섰고 Qua. 0.979로 per-crop consistency에 0.001 뒤지는 데 그쳤다.

실무 관점에서 이 논문이 주는 신호는 명확하다. 한자·가나·한글처럼 조합 구조를 가진 문자를 생성하거나 평가하는 파이프라인이라면, 문자 단위 정답/오답 라벨은 부분 진전을 전혀 반영하지 못한다. IDSpect의 구조는 보상 모델을 별도로 학습시키고 학습 후 폐기하는 방식이라 추론 지연을 늘리지 않는다는 점에서 실서비스 적용 부담이 작다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, IDS 인식기의 신뢰도가 훈련 데이터 분포에 그대로 좌우된다는 점이다. 자연 장면 텍스트로 학습하면 빈도 지름길이 생겨 내부 구조 오류를 못 잡으므로, 균형 잡힌 합성 데이터 구성이 사실상 필수 전제다. 둘째, 보상 가중치 λ를 0.5로 고정했다는 점이다. 셋째, 분해가 GB 18030-2022와 BabelStone 사전 커버리지, 그리고 재귀 깊이 10이라는 상한에 묶여 있다는 점이다. 저자들도 향후 작업으로 더 넓은 한자 커버리지와 일본어·한국어 같은 다국어 문자로의 확장을 계획한다고 밝히고 있으며, 그 외의 명시적 한계 분석은 원문에 제시되지 않았다.