에이전트 하네스의 프롬프트 개선을 확산 모델 가중치에 증류한다

Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation

HF Daily2610.07250

Wenxuan Wang, Zekai Liu, Weinan Zhang2026-10-05

무엇인가

텍스트-이미지 생성 모델을 에이전트 하네스로 감싸면 성능이 크게 오른다. 하네스는 메모리, 스킬, 워크플로 오케스트레이션, 결과 검증, 반복 개선을 동원해 프롬프트를 계속 만들고 고쳐 쓴다. 문제는 이 이득이 확산 모델 바깥에 머문다는 점이다. 하네스가 통째로 돌아갈 때만 실현되고, 모델 자체는 변하지 않는다. 저자들은 여기서 두 가지 비용을 지적한다. 메모리와 스킬이 쌓일수록 필요한 지침을 검색하기 어려워지고, 매 요청마다 추론·검증·재생성을 반복해야 한다. 그래서 던지는 질문은 이것이다. 하네스 진화로 얻은 이득을 생성기 가중치에 내재화해서, 추론 시점에 외부 지침 없이도 그 이득을 유지할 수 있는가.

어떻게 동작하나

제안 방법은 Diffusion On-Policy Context Distillation(D-OPCD)이다. 핵심 인터페이스는 프롬프트다. 하네스가 태스크마다 확산 모델을 여러 번 호출하고, 그중 제출용으로 선택된 (프롬프트, 이미지) 쌍을 남긴다. 이때 선택된 프롬프트 p_i를 '특권 문맥(privileged context)', 원래 질의 q_i를 학생의 조건으로 둔다. 교사 모델은 [q_i; p_i]를 함께 조건으로 받고, 학생 모델은 q_i만 받는다. 두 모델은 학생이 스스로 만든 디노이징 궤적 위에서 비교된다. 학생이 노이즈에서 출발해 자기 속도장으로 롤아웃을 만들고, 그 방문 상태들에서 학생과 교사가 각각 속도를 예측한다. 손실은 학생 예측과 교사 예측(정지 기울기 적용) 사이의 L2 제곱 오차를 롤아웃 스텝 K에 대해 평균한 것이다. 교사는 학생 가중치의 지수이동평균으로 갱신된다. 롤아웃에는 기울기가 흐르지 않는다. 저자들은 이 설계가 (p_i, I_i)로 직접 지도학습하는 것도, (q_i, I_i)로 학습하는 것도 못 하는 전이를 가능하게 한다고 주장한다. 전자는 하네스 지식이 입력에 남고, 후자는 특권 신호를 버리면서 학생이 방문하지 않은 상태를 지도해 오프폴리시 불일치를 만든다.

무엇과 다른가

데이터를 공급하는 장치가 Auto Skill Evolver(ASE)다. ASE는 테스트 시점 학습 프레임워크로, 경험을 세 층으로 조직한다. 에피소드는 한 태스크의 전체 실행 궤적과 외부 평가자 피드백이고, 인사이트는 에피소드에서 뽑아낸 '사전에 알려줄 수 있었던 발견'이며, 스킬은 여러 인사이트를 첫 생성 프롬프트 작성용 재사용 지침으로 통합한 것이다. 태스크는 배치 단위로 흐르고, 검증 실패 시 인사이트 풀에서 관련 인사이트를 검색해 프롬프트 개선에 쓴다. 배치가 끝나면 인사이트 관리자가 생성·지지·수정·반박·병합·보관을 수행하고, 지지 수가 임계값 τ를 넘고 반박 수보다 많아지면 성숙한 인사이트가 된다. 성숙 인사이트가 B개 이상 쌓이면 스킬 관리자가 스킬 라이브러리를 만들거나 고치거나 쪼개거나 병합하거나 폐기한다. 커밋된 스킬 라이브러리 하나가 하네스 버전 하나이며, 홀드아웃 집합에서 최고 성능을 낸 버전만 내재화 대상으로 채택된다.

어떻게 쓰나

실험은 GenEval, GenEval2, WISE, R2I-Bench 네 벤치마크에서 이뤄졌고, T2I-CompBench++는 분포 밖 평가용으로 남겨뒀다. 초기 생성기는 Z-Image-Turbo, 에이전트는 GEMS 기반 스캐폴드에 빈 스킬 라이브러리로 시작한다. 기준선 대비 효과는 이렇다. 하네스 없이 직접 생성하면 네 벤치마크 평균 60.52점이다. 스킬 없는 하네스만 붙여도 79.28점(+18.76)으로 오르고, ASE가 진화시킨 스킬까지 붙이면 81.83점(+2.55)이 된다. D-OPCD로 학습한 생성기는 하네스 없이 q_i만으로 65.09점을 기록해 네 벤치마크 모두에서 기준 생성기를 앞선다. WISE에서는 기준 대비 7.14점 오른다. 내재화 후 스킬 없는 하네스를 다시 붙이면 평균 82.33점으로, 원래 스킬 장착 에이전트를 근소하게 넘는다. 부호 있는 내재화 격차 δ는 +0.50이고, R2I-Bench에서는 +4.27이다. 이어서 스킬을 초기화하고 ASE를 다시 돌리면 세 벤치마크에서 추가 개선이 나와 평균이 갱신된 스킬 없는 에이전트와 원래 스킬 장착 에이전트를 모두 웃돈다. 다만 R2I-Bench는 스킬 재진화 후 오히려 떨어진다.

전제와 한계

학습 방법 비교에서는 같은 레코드, 같은 Z-Image-Turbo 가중치, 같은 LoRA 예산으로 Vanilla SFT, Diffusion-DPO, D-OPSD와 겨룬다. 네 방법 모두 기준 생성기를 1.66~4.57점 끌어올리는데, D-OPCD가 평균 65.09로 가장 높고 Vanilla SFT보다 1.71점 앞서며 네 벤치마크 전부에서 1위다. 교사 조건 절제 실험도 있다. 학생은 q_i로 고정한 채 교사 입력만 바꿔서, 짝이 맞는 [q_i; p_i]가 65.09, p_i 단독이 64.63, 다른 태스크의 프롬프트로 섞은 [q_i; p_σ(i)]가 61.05였다. 섞기는 네 벤치마크 모두 점수를 떨어뜨린다. p_i 단독은 R2I-Bench에서 47.32로 최고점을 낸다. 문맥 속성을 바꾼 실험도 있다. 에이전트 내부 검증기가 직접 질의 이미지보다 통과 횟수가 엄격히 높은 쌍만 남기는 개선 필터와, 프롬프트 반복 패턴을 줄이는 다양성 어댑터를 적용했는데 결과는 엇갈린다. 필터는 평균을 거의 바꾸지 못했고 어댑터는 평균을 낮췄다. 분포 밖 평가에서는 GenEval과 GenEval2로 학습한 체크포인트가 T2I-CompBench++의 Color를 77.45에서 81.61, 81.44로, 2D-Spatial을 32.32에서 36.19, 37.33으로 올렸다. WISE와 R2I-Bench로 학습한 체크포인트는 기준과 비슷한 수준에 머문다.

실무적으로 이 논문이 건드리는 지점은 '프롬프트 계층에서 얻은 성능을 어디에 둘 것인가'다. 프롬프트 리라이팅, 검증 루프, 스킬 라이브러리로 품질을 끌어올리는 파이프라인을 운영 중이라면, 그 이득을 매 요청마다 재계산하는 대신 소량의 LoRA 학습으로 가중치에 옮기는 선택지를 검토할 수 있다. 특히 하네스가 커질수록 스킬 선택이 어려워지고 컨텍스트 비용이 늘어나는 문제를 겪는 팀에 직접적이다. 다만 확인해야 할 것이 있다. 이 방법이 옮기는 것은 프롬프트를 매개로 한 이득뿐이다. 검증이나 확률적 샘플 선택에서 나온 이득은 전이되지 않는다. 또한 내재화 후 스킬을 비우고 다시 진화시키는 절차가 성능을 더 올리긴 했지만 R2I-Bench처럼 역효과가 나는 벤치마크도 있어, 어떤 태스크군에서 재진화가 이득인지 사전에 알기 어렵다.

저자들이 명시한 전제와 한계는 이렇다. 첫째, 하네스 경험과 생성기 학습 사이의 인터페이스로 프롬프트만 남겼기 때문에 검증이나 확률적 샘플 선택에서 오는 이득은 포착되지 않는다. 둘째, 하네스 자체에 용량 한계가 있다. 스킬이 하나 늘 때마다 컨텍스트를 소비하고 추론 시점에 올바른 스킬을 고르기 어려워진다. D-OPCD는 이 한계를 부분적으로 덜어줄 뿐이다. 셋째, 어떤 하네스 산출 문맥이 모델 내재화에 가장 잘 맞는지는 열린 문제로 남는다. 개선 필터와 다양성 어댑터의 결과가 엇갈렸고, 필터는 학습 집합의 크기와 구성까지 바꾸기 때문에 효과를 태스크 개선만으로 돌릴 수 없다. 생성 중에 유용한 프롬프트가 질의만 받는 학생에게 내재화하기 쉬운 프롬프트라는 보장은 없다는 것이 저자들의 결론이다.