공개 문서를 교란해 문맥 학습 능력을 키우는 합성 데이터 파이프라인

Learning to Learn from Context: Synthetic Training from Perturbed Public Documents

HF Daily2609.33642

Haoyi Wu, Yang Xiao, Yusong Sun2026-09-27조회 2

무엇인가

이 논문이 다루는 문제는 LLM이 사전학습된 파라메트릭 지식을 꺼내는 것이 아니라, 주어진 문맥을 읽고 그 문맥에 맞춰 추론하는 능력이다. 저자들은 이를 문맥 학습(context learning)이라 부르며, 지식 검색과 구분한다. 사내 문서·매뉴얼 기반 질의응답, 검색된 구절에 대한 추론, 에이전트가 소비하는 도구 출력과 로그 해석, 계획이 명세를 준수하는지 검사하는 작업이 모두 여기에 해당한다. 문제는 이 능력이 여전히 약하다는 점이다. 18개 도메인에 걸친 1,899개 장문서 태스크로 구성된 CL-bench에서 최전선 모델조차 30% 미만을 푼다. 실패 양상도 특징적인데, 그럴듯해 보이는 답을 내놓지만 세밀한 검증에서 무너진다. 사전학습 코퍼스에 장문서가 충분히 있었는데도 이런 약점이 남는 이유는, 사전학습이 문서가 무엇을 말하는지는 가르치지만 문서에 조건화해 답하는 법은 가르치지 않기 때문이다. 사람이 주석을 다는 대안은 단일 질문 하나를 만들기 위해 수만 단어 문서를 설계하고 답을 검증하고 정답 요건까지 명세해야 할 만큼 비싸다.

어떻게 동작하나

저자들의 출발점은 공개 고품질 문서를 쓰되 암기 위험을 없애는 것이다. 공개 웹 문서는 이미 사전학습에 소비됐을 가능성이 커서 그대로 학습하면 문맥 학습이 아니라 암기를 보상하게 된다. 그래서 문서 자체를 조금 교란한다. 파이프라인은 네 단계다. 첫째, GLM-5.2가 각 원본 문서를 고유명사 개명, 숫자 교란, 섹션 번호 재배치, 리스트 순서 섞기를 통해 다시 쓴다. 이 재작성은 완벽할 필요가 없고, 교사 모델이 파라메트릭 기억으로 답하지 못하고 문서를 읽고 추론하도록 강제하는 것이 목적이다. 둘째, 재작성된 문서마다 최대 3개의 질문과 각각 최소 7개 루브릭을 생성한다. 9가지 페르소나 원형, 7가지 질문 유형(심층 추론, 사실 검색, 계산 등), 4가지 루브릭 유형(과정·내용·페르소나·형식)을 조합하며, 루브릭 중 최소 5개는 문서의 구체적 값을 인용해야 한다. 셋째, 교사 모델이 재작성 문서를 문맥으로 답하되 자신의 추론 트레이스를 그대로 남긴다. 사후에 추론을 다듬거나 답을 수정하지 않는데, 정제된 버전보다 교사의 자연스러운 추론 트레이스가 더 효과적이었다고 밝힌다. 넷째, 갭 검사(gap check)다. 같은 질문을 문서와 함께 한 번, 문서 없이 한 번 답하게 하고 판정 모델이 루브릭 통과율을 매긴다. 문서 포함 통과율 p+가 0.60 이상, 문서 없음 통과율 p-가 0.30 이하, 그 차이 p+ - p-가 0.40 이상일 때만 샘플을 채택한다. 형식·페르소나·환각 방지 루브릭은 문서 없이도 통과할 수 있으므로 p-가 0이 될 필요는 없다. 생성 샘플의 32.5%가 이 검사에서 탈락하며, 탈락 사유를 문맥에 넣어 질문과 루브릭을 재생성하는 재시도 메커니즘을 둔다.

무엇과 다른가

결과물은 사람 주석 없이 3,515개 공개 문서에서 만든 9,625개 학습 샘플이다. 문서 출처는 IETF RFC, SEC 공시, 법원 판결문, arXiv 논문, 공개 핸드북, 위키, 백과사전 등이며, 암기 위험을 줄이기 위해 최근 6개월 내 생성된 문서를 우선 선택한다. CL-bench의 18개 하위 범주 중 16개를 커버한다. 저자들은 LLM이 직접 합성한 문맥은 논리적으로 단순하고 동질적인 경향이 있어 그런 데이터로 학습한 모델은 성능 향상이 적었다고 덧붙인다.

어떻게 쓰나

실험은 Qwen3.6-35B-A3B를 학생 모델로, 질문 생성에 GLM-5.2, 답변 생성 교사로 기본 Qwen3.8-2.4T를 쓴다. SFT는 3 에폭, 전역 배치 32, 최대 시퀀스 길이 131K, AdamW(β1=0.9, β2=0.95), 코사인 감쇠에 최대 학습률 5e-6, 워밍업 10%, 최종 학습률 1e-7, 가중치 감쇠 0.1, 그래디언트 클리핑 1.0 조건에서 수행한다. CL-bench 정확도는 베이스라인 13.7%에서 SFT 22.8%로 오르고, 루브릭 보상을 쓰는 GSPO 강화학습 단계를 거치면 24.6%가 된다. CL-bench Life는 12.6%에서 13.8%로 오른다. 이는 1조 개 이상 파라미터의 Qwen3.8-2.4T(23.9%)와 HY3(23.5%)에 필적하는 수치다. 흥미로운 점은 교사 의존성이다. 동일한 질문에 교사만 바꿔 학습시킨 학생 성능이 CL-bench에서 19.7%에서 22.8%까지 벌어지는데, 교사 자체 성능이 가장 높은 Kimi-K3(27.0%)가 가장 약한 학생(19.7%)을 만들고 중위권 교사인 Qwen3.8-2.4T(23.9%)가 가장 좋은 학생(22.8%)을 만든다. SFT 초기화 없이 베이스 모델에 바로 강화학습을 걸면 13.7%에서 16.9%로 오르는 데 그친다. 저자들은 SFT 단계가 대부분의 루브릭을 간간이 만족하는 초기 상태를 만들어야 강화학습이 유의미한 보상 신호를 받는다고 설명한다.

전제와 한계

향상은 목표 벤치마크를 넘어 전이된다. SFT 기준으로 장문맥 이해(LongBench v2 +2.9, AALCR 62.6→69.8, MRCR +2.1), 지시 따르기(IFBench 57.7→71.7, AdvancedIF +3.3), 추론(ARC-AGI-1 47.4→63.8, ARC-AGI-2 +11.8, GPQA +5.1, HMMT-2025 +4.1)이 크게 개선된다. 반면 코드 생성은 사실상 그대로이고(LiveCodeBench +0.5, OJBench -0.9), 지식은 소폭 하락한다(SimpleQA 20.9→18.7, CEval -1.0, MMLU-Pro +0.7, SuperGPQA +0.6). 학습 데이터가 세계 지식이 아니라 문맥 사용을 가르치기 때문이다. 강화학습은 AALCR·GPQA-Diamond·HMMT-2025는 개선하지만 ARC-AGI-1(-12.0)과 ARC-AGI-2(-9.4)는 눈에 띄게 떨어뜨려, 추가 이득이 목표 능력에 집중되고 일반 성능 전반으로 균일하게 전이되지는 않는다.

절제 실험은 설계 선택을 뒷받침한다. 갭 검사를 적용하지 않은 3,000개 샘플로 학습한 모델은 17.75%, 통과 샘플 3,000개로 학습한 모델은 19.17%를 기록해 필터링이 실제로 유효하다. 데이터 규모를 100·300·1,000·3,000·9,625개로 늘리면 성능이 단조 증가해 1,000개에서 20.2%, 전체 풀에서 22.8%가 되며 테스트 범위 안에서 포화가 보이지 않는다. 강화학습 보상 설계도 실험했는데, 8k에서 16k 토큰까지 선형으로 길이 페널티를 주면 추론 트레이스는 짧아지지만 CL-bench 정확도가 24.6%에서 20.91%로 급락한다. 루브릭 수준 통과율에 과제 수준 통과율을 가중 평균으로 더하면 오히려 SFT 대비 개선이 없다. 또한 강화학습 후 모델은 환각 방지를 요구하는 루브릭에서 실패율이 약 2% 높아, 루브릭을 만족시키려 더 많은 내용을 생성하다 환각을 대가로 치르는 보상 해킹 경향을 보인다.

저자들이 밝힌 한계와 전제는 분명하다. 재현성 측면에서 공식 CL-bench 판정 프롬프트가 OpenAI 콘텐츠 모더레이션을 대량으로 유발해(HTTP 400) 전각 괄호를 반각으로 바꿔 사용했고, 이 치환이 판정 동작을 바꿔 편향을 도입할 위험이 있다고 명시한다. 결과는 공식 프롬프트와 유사할 것으로 보지만 동일하다고 보장할 수 없다. 또한 성능이 교사 모델에 의존하며, 강화학습은 목표 능력 외의 일반 벤치마크에서 일관된 추가 이득을 주지 못한다. 흥미로운 관찰도 있다. CL-bench 문맥 500개를 감사한 결과 55.4%가 공개 문서, 7.2%가 수정된 공개 문서, 36.8%가 허구 문맥이었고, 태스크 기준으로는 44%가 공개 문서, 56%가 허구 문맥이었다. 그런데 성능 향상의 대부분은 허구 문맥에서 나온다(17.5%→31.1%→32.9%). 공개 문서에서는 9.0%→12.2%→14.1%에 그친다. 저자들은 공개 문서 태스크가 더 어려울 가능성을 인정하면서도, 학습 데이터가 허구 문맥으로 전이되는 일반적 추론 모드를 가르친다는 증거로 해석한다. 실무 관점에서 이 파이프라인은 사내 규정·매뉴얼·계약서처럼 이미 모델이 봤을 법한 긴 문서를 근거로 답하게 만드는 학습 데이터를 사람 손 없이 만들고 싶을 때 참고할 만하다. 다만 지식 벤치마크가 소폭 희생된다는 점, 교사 선택이 결과를 좌우한다는 점, 강화학습 보상이 환각을 유발할 수 있다는 점을 함께 확인해야 한다.