TextReg가 프롬프트 과적합을 표현 비효율로 규정하고 정규화한다

TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization

HF Daily2605.21318

Lucheng Fu, Ye Yu, Yiyang Wang2026-10-05

무엇인가

LLM은 프롬프트에 극도로 민감하고, 그래서 LLM 평가자의 자연어 피드백으로 프롬프트를 반복 재작성하는 최적화 기법들이 널리 쓰인다. 문제는 이렇게 얻은 프롬프트가 학습 데이터에서는 좋아지는데 그 밖에서는 무너진다는 점이다. 최적화가 진행될수록 프롬프트는 길어지고, 특정 예시에만 적용되는 예외·규칙·스타일 제약이 덧붙고, 입력 변형에 취약해진다. 저자들은 이 실패 모드를 프롬프트 분포 과적합(prompt distributional overfitting)이라 부르고, 단순한 최적화 동역학의 부산물이 아니라 이산 텍스트 공간 최적화에서 표현(representation)을 통제하지 못한 결과라고 규정한다.

어떻게 동작하나

이를 위해 논문은 표현 비효율(representational inefficiency)이라는 두 인자 곱 지표를 제안한다. 프롬프트를 의미적으로 구분되는 행동 지시문들의 집합으로 보고, 각 지시문의 일반화 범위 s(r)를 입력 공간 전체에서의 평균 관련도로 정의한 뒤, 프롬프트의 비효율을 I(p) = C(p)·W(p)로 쓴다. C(p)는 토큰 길이에서 오는 용량 비용, W(p)는 평균 범위의 여집합인 범위 협소화다. 곱셈 형태인 이유는 상호작용을 강조하기 위해서다. 길이가 길어도 넓게 적용되는 규칙이면 덜 나쁘고, 좁은 규칙이라도 짧으면 덜 나쁘지만, 길면서 좁은 규칙 위주면 비효율이 급격히 커진다. 이상적 목표는 L(p) + λI(p) 최소화지만, 이산 텍스트 공간에서는 미분이 불가능하므로 이 식은 개념적 정규화 목표로만 제시되고 수치적으로 풀리지 않는다.

무엇과 다른가

TextReg는 이 목표를 세 단계로 구현한다. 첫째, Dual-Evidence Gradient Purification은 LLM이 만든 텍스트 그래디언트를 재작성에 넣기 전에 걸러낸다. 현재 미니배치 증거로 특정 엔티티·수량·표면 패턴에 묶인 교정을 좁은 패치로 판정하고, RuleBank에 축적된 재발 증거로 여러 표면형에 걸쳐 반복 회수되는 지시문을 일반 규칙으로 판정한다. 각 그래디언트는 GENERALIZED_RULE, CASE_PATCH, STYLE_ONLY로 분류되어 일반 규칙만 남고 나머지는 버려진다. 둘째, Semantic Edit Regularization은 실제로 일어난 편집 (p_{t-1}, p_t)을 관찰한다. 용량 채널은 토큰 길이의 상대 변화가 임계값 τ_C를 넘는지로 정확히 측정하고, 범위 채널은 LLM 의미 diff 분석기로 규칙 변경 목록과 범위 협소화의 부호만 추정한다. 활성화된 채널에 따라 컨트롤러가 압축 지침 또는 일반화·패치 제거 지침 g_reg를 만들고, 둘 다 아니면 비운다. 셋째, Regularization-Guided Prompt Update는 태스크 신호가 무엇을 바꿀지를, 정규화 신호가 그것을 어떻게 표현할지를 담당하게 한다. 태스크 충실성을 우선하는 폴백을 두어, 태스크에 꼭 필요한 확장을 정규화가 억누르지 못하게 한다.

어떻게 쓰나

실험은 Big Bench Hard의 Logical Deduction(3/5/7 객체)과 Tracking Shuffled Objects(3/5/7 객체), 그리고 GSM8K·SVAMP·MultiArith에서 이뤄졌다. 프롬프트는 LD(3객체), TSO(3객체), GSM8K에서 최적화하고, 더 어려운 변형과 나머지 산술 데이터셋에서 분포 밖 일반화를 평가한다. 테스트 엔진은 Qwen2-7B-Instruct, Phi-3.5-Mini-Instruct, Llama-3-8B-Instruct, Llama-3.1-8B-Instruct 네 종이고, 최적화에는 Qwen2.5-7B-Instruct를 전방 엔진, GPT-4o를 후방 엔진으로 공통 사용한다. 비교 대상은 zero-shot CoT, TextGrad, REVOLVE이며 지표는 최종 답안 exact match 정확도, 시드 4회 평균이다.

전제와 한계

결과에서 TextReg는 거의 모든 (엔진, 데이터셋) 조합에서 최고 또는 차선 정확도를 기록했고, TextGrad 대비 최대 +11.8%, REVOLVE 대비 최대 +16.5%를 얻었다. 원래 과제의 어려운 변형에서 격차가 두드러진다. Tracking Shuffled Objects에서 Llama-3.1-8B-Instruct 기준 5객체 +10.0, 7객체 +9.9, Llama-3-8B-Instruct 기준 5객체 +8.4, 7객체 +10.3이다. 특히 Phi-3.5-Mini-Instruct에서는 REVOLVE가 여섯 데이터셋 전부에서 최적화하지 않은 CoT보다 낮은 정확도를 보였는데, 저자들은 이를 프롬프트 과적합 문제가 실제로 드러난 증거로 제시한다. 절제 실험에서 세 구성요소를 하나씩 제거하면 TSO(5/7객체)와 LD(5/7객체) 네 과제, 네 엔진 모두에서 정확도가 일관되게 떨어졌다. 세 LLM 역할(그래디언트, 정규화, 옵티마이저)을 각각 더 약한 Qwen2.5-7B-Instruct로 교체해도 성능 하락은 미미했고, 가장 어려운 TSO 7객체에서는 정규화와 옵티마이저를 약화한 쪽이 오히려 전체 GPT-4o 구성보다 나았다.

실무적으로 이 논문은 프롬프트를 자동 개선하는 루프를 돌리는 팀에 진단 도구를 준다. 시스템 프롬프트나 에이전트 지시문, 평가 프롬프트를 반복 튜닝하면서 학습셋 점수는 오르는데 실제 트래픽 성능이 정체·하락한다면, 길이 증가와 규칙 범위 협소화를 분리해서 보라는 것이다. RuleBank처럼 반복 회수되는 지시문에 재발 증거를 쌓아 일회성 패치를 걸러내는 아이디어, 그리고 편집 후 길이 변화와 의미 변화를 따로 감시해 필요할 때만 개입하는 구조는 자체 파이프라인에 이식하기 쉬운 편이다. 다만 최적화 루프에 GPT-4o급 후방 엔진을 전제로 한 비용 구조와, 검증 범위가 단일 턴 추론 과제라는 점은 도입 전에 따져야 한다.

저자들이 명시한 한계도 분명하다. 평가는 행동 규칙이 잘 정의된 단일 턴 추론에 집중되어 있고, 오픈엔드 생성, 더 넓은 생성 과제, 멀티턴 프롬프트, 에이전트 지시문은 부록의 예비 결과 수준이며 향후 과제로 남긴다. 그런 설정에서는 규칙 구조가 덜 명시적이고 용량 비용이 턴 사이에 공유될 수 있다는 점을 인정한다. 또한 I(p)는 수치적으로 평가되지 않는 개념적 목표이고, 범위 협소화는 방향성만 추정된다는 전제가 방법 전체에 깔려 있다.