STRETCH는 모델 실력에 맞춘 난이도 상승 단일 파라미터 자기학습 프레임워크다.
STRETCH the Boundaries: A Unified Self-Taught Framework for Progressive LLM Evolution
무엇인가
이 논문은 LLM의 자기개선(self-improvement) 훈련이 겪는 정체 문제를 다룬다. 기존 강화학습 기반 후속학습은 정적 데이터셋이나 미리 정해둔 난이도에 모델을 벤치마킹하는데, 모델이 그 고정 분포를 마스터하면 곧바로 능력 정체(plateau)에 빠져 조기 수렴한다. 반대로 초기 과제가 지나치게 어려우면 유효한 추론 궤적을 찾지 못해 보상이 붕괴한다. 저자들은 인지적 비계(scaffolding) 이론에서 착안해 학습 공간을 Comfort Zone, Stretch Zone, Difficulty Zone으로 나누고, 학습은 항상 Comfort Zone 바로 바깥의 동적 경계인 Stretch Zone에 정박해야 한다고 주장한다. 모델이 강해지면 Stretch Zone은 위로 이동하는데 환경은 고정되어 있으니 모델이 다시 Comfort Zone으로 되돌아간다는 것이 문제 진단의 핵심이다.
어떻게 동작하나
제안 방법 STRETCH(Self-Taught Reasoning Evolution via Targeted CHallenge)는 하나의 파라미터 공간 π_θ 안에서 두 개의 인지적 역할을 역할별 시스템 프롬프트만으로 전환한다. 하나는 적응적이고 경계를 밀어붙이는 과제를 생성하는 Scaffolder, 다른 하나는 강화학습으로 자신의 풀이 궤적을 최적화하는 Learner다. 두 개의 분리된 모델을 유지·동기화하는 기존 공동진화 프레임워크와 달리 가중치를 공유한다. 훈련은 교대 단계 업데이트로 진행된다. Difficulty Alignment(좌측 루프)에서는 Learner의 과거 스냅샷을 동결한 채 Scaffolder를 최적화하고, Exploration(우측 루프)에서는 동결된 Scaffolder가 만든 제약에 대해 Learner를 최적화한다. 이 분리 루프가 각 업데이트 단계에 일관된 보상 신호를 보장한다.
무엇과 다른가
Scaffolder 최적화의 구체적 절차는 다음과 같다. 기본 과제 맥락 c가 주어지면 Scaffolder가 m개의 후보 질문 그룹을 샘플링하고, 동결된 Learner가 각 질문마다 m개의 추론 궤적을 독립적으로 샘플링한다. 외부 LLM-as-a-Judge가 각 해답의 정답 여부를 평가해 경험적 성공률 p̂_i를 계산하고, 난이도 정렬 보상 R_diff(q_i) = (p̂_i(1−p̂_i))^α를 준다. 베르누이 결과의 분산이 p(1−p)이므로 이 보상은 p=0.5에서 최대가 되며, 즉 상대정책 업데이트에 가장 정보량이 많은 성공/실패 피드백 구간을 겨냥한다. 전부 맞히거나(p̂→1) 전부 틀리면(p̂→0) 벌점을 받는다. 그룹 내 보상을 정규화해 어드밴티지를 구하고 GRPO 목적함수로 Scaffolder를 갱신한다. Learner 쪽에서는 동결된 Scaffolder가 난이도 정렬된 질문 q_adapt를 생성하고, Learner가 m개의 궤적을 샘플링해 정확도 보상 R_acc를 받는다. 운영연구 과제에서는 코드 실행과 최적성에 따른 이진 보상, 협상 과제에서는 거래 성사와 전략 일관성을 평가한 결합 점수다. 이후 같은 GRPO 방식으로 Learner를 갱신한다. 여기에 두 가지 안정화 장치가 붙는다. 매 스텝마다 Scaffolder 업데이트 1회와 Learner 업데이트 1회를 미세 교차 실행하고, N스텝 후에는 성공한 상호작용에서 고품질 적응 질문과 최적 추론 흔적을 수확해 (x, y) 프롬프트-완성 쌍으로 만든 Golden Experience Replay 버퍼로 SFT 손실 L_SFT = −E[log π_θ(y|x)]를 적용한다. 전체 목적식은 max_θ E_{q∼π_θ}[I_valid(q) R_diff(q)] + λ R_replay(θ)이며, R_replay = −L_SFT다. 이 리플레이는 장기 강화학습에서 흔한 포맷 붕괴를 완화하는 행동 정규화 장치로 작동한다.
어떻게 쓰나
실험은 성격이 크게 다른 두 제약 추론 영역에서 이뤄졌다. 소프트 제약인 다중 턴 협상은 CraigslistBargain 데이터셋으로 평균 턴 수(AT, 낮을수록 좋음), 성사율(SR), 가격 격차(PG)를 측정했고, 하드 제약인 운영연구는 Mano Complex와 Complex OR에서 코드 실행률(ER)과 해결 정확도(SA)를 측정했다. 베이스라인은 협상의 경우 Vanilla LLM, GDPZero, Pro-CoT, DPDP, DMNA, 운영연구의 경우 Vanilla, CoT, ORLM, LLMOPT, StepORLM이며, 추가로 Absolute Zero(AZR)와 R-Zero를 동일 과제 맥락·평가 프로토콜로 재구현해 비교했다. 백본은 Qwen2.5-7B-Instruct와 Llama-3.1-8B-Instruct, LoRA 파인튜닝, NVIDIA H100 2장, Scaffolder 질문 n=8개, Learner 궤적 m=8개, 판정은 GPT-4o-mini다. 결과는 Qwen2.5-7B 기준 Complex OR에서 ER 58.7%, SA 55.0%로 StepORLM의 57.3% ER, 52.6% SA를 넘었고, Mano Complex에서는 ER 67.9%, SA 63.6%로 AZR(63.4%/60.1%)과 R-Zero(64.8%/61.7%)를 앞섰다. Llama-3.1-8B 백본에서는 Mano Complex SA 54.8%, Complex OR SA 49.5%로 최고치를 기록했다. 협상에서는 Qwen2.5-7B 기준 SR 0.79, PG 0.61, AT 7.32로 R-Zero 대비 SR 0.07, PG 0.08 개선, AZR 대비 SR 0.06, PG 0.07 개선을 보였다. Llama-3.1-8B에서는 SR 0.75, PG 0.73으로 최고였지만 AT는 DPDP의 6.83이 가장 짧았다. 저자들도 모든 백본의 모든 지표에서 최고라고 주장하지 않고, 성사율과 수익성에서의 우위로 한정한다.
전제와 한계
절제 실험은 동적 난이도 정렬의 필요성을 뒷받침한다. Scaffolder를 초기 상태로 동결한 Untrained-Frozen은 최하한이었고, 기본 제약 생성 패턴만 SFT로 학습한 뒤 동결한 SFT-Frozen은 초기 성능은 높았지만 Epoch 2 이후 완전히 평평해졌다. 외부 Scaffolder(GPT-4o-mini)는 초반에 강했으나 중반에 정체했는데, Learner의 인지 경계를 구조적으로 내재화하지 못하고 공유 골든 리플레이의 이점을 받지 못하기 때문이다. 이진 보상으로 바꾼 변형은 사소한 문제와 불가능한 문제 사이를 무작위로 오가 심한 성능 분산과 예측 불가능한 하락을 보였다. 반면 연속 보상 R_diff를 쓰는 STRETCH는 안정적인 상승 나선을 유지했다. 공동진화 복잡도 분석에서는 평균 토큰 길이를 인지적 복잡도의 대리 지표로 삼았는데, 운영연구 영역에서 6에폭 동안 Scaffolder의 질문이 평균 35토큰에서 156토큰으로, Learner의 최적 코드·추론 흔적이 123토큰에서 416토큰 이상으로 동시에 확장됐다. 또한 Scaffolder와 Learner가 하나의 어댑터를 공유하는 것이 역할별 LoRA를 따로 두는 것보다 일관되게 강했고, 리플레이가 없으면 Epoch 4에서 포맷 붕괴가 나타났으며, 목표 성공률은 p=0.5가 p=0.8이나 p=0.2보다 우수해 Mano Complex에서 ER 67.9%, SA 63.6%, 협상에서 SR 0.79, PG 0.61을 기록했다.
개발자 관점에서 이 논문의 실무적 가치는 자기대국·자기개선 학습 루프를 설계할 때의 구체적 레시피에 있다. 출제자와 풀이자를 별도 모델로 두지 않고 하나의 어댑터로 공유하고 역할 프롬프트로만 전환하는 방식, 스텝 단위 교차 GRPO 업데이트, 에폭 단위 골든 리플레이 SFT, 그리고 난이도 목표를 정답률 50%로 명시적으로 고정하는 설계는 그대로 차용 가능한 패턴이다. 다만 이 레시피가 작동하려면 과제 생성과 채점이 신뢰할 수 있는 검증기(코드 실행기, 규칙 기반 판정, 또는 안정적인 LLM 심판)를 전제로 하며, 보상 해킹을 막기 위해 유효성 판정과 난이도 보상을 분리해야 한다는 점을 확인해야 한다. 또한 논문이 제시한 수치는 특정 백본과 LoRA 설정, GPT-4o-mini 판정 조합에서 얻은 것이므로 자체 도메인에 적용할 때는 검증기 신뢰도와 판정 모델 편향을 먼저 점검하는 편이 좋다.
저자들이 명시한 한계는 두 갈래다. 첫째, 보상 검증 가능성과 시뮬레이터 의존성이다. 운영연구에서는 불가능한 제약이 프로그램 검증기에서 결정적으로 거부되지만, 협상에서는 GPT-4o-mini가 판매자 시뮬레이터이자 보상·평가 파이프라인의 일부를 겸한다. 따라서 성능 향상의 일부가 그 모델의 행동과 선호에 적응한 결과일 수 있고, 서비스가 바뀌면 결과도 달라질 수 있다. 저자들은 신뢰할 수 있는 과제 생성과 검증이 가능한 설정으로 주장을 제한하고, 프롬프트와 결정적 대화 시드를 코드로 공개하며, GPT-4o-mini를 다른 평가자로 교체할 수 있게 설계했다고 밝힌다. 독립적 인간 평가나 교차 시뮬레이터 평가가 이 설정 밖으로의 전이를 입증하기 위해 여전히 필요하다. 둘째, 비제약 환경으로의 일반화다. STRETCH는 인지적 복잡도와 과제 제약을 형식적으로 정의하고 객관적으로 평가할 수 있는 영역에서만 검증됐으며, 객관적 난이도 기울기가 주관적이거나 다차원적이거나 명확한 수학적 경계가 없는 개방형 과제에 이 공동진화를 확장하는 것은 미해결 문제다. 이에 따라 저자들은 자신들의 실증적 주장을 평가된 제약 기반 설정으로 한정하며, 일반적인 개방형·자율적 LLM 진화를 입증하지는 않는다고 못 박는다.