ROFT는 자기 회고 설명만으로 에이전트를 학습해 보상 없이 GRPO를 앞선다

Shockingly Simple Self-retrospection Improves Agentic Models Without RL

arXiv2609.35741v1

Jonathan Light2026-09-28조회 3

무엇인가

에이전트 학습의 표준은 결과 보상이다. RLVR(검증 가능 보상 강화학습)과 GRPO는 샘플링한 시도들 사이의 상대 보상으로 정책을 업데이트한다. 문제는 성공/실패라는 단일 스칼라가 "어느 가정이 틀렸는지, 어느 결정이 중요했는지, 교정이 언제 적용되어야 하는지"를 알려주지 않는다는 점이다. 보상이 희소할 때는 더 나쁘다. 한 그룹의 모든 시도가 실패하면 그룹 내 이진 보상 대비가 0이 되어 정책 경사 신호 자체가 사라진다. 이 논문은 여기서 출발한다. 에이전트가 자기 경험에 대한 회고적 설명만으로 학습해서 이후 행동을 개선할 수 있는가.

어떻게 동작하나

제안 방법은 Retrospection-Only Fine-Tuning(ROFT)이다. 절차는 의도적으로 최소하다. 에이전트가 과제 x를 시도해 상호작용 궤적 τ와 사용 가능한 피드백 v를 얻으면, 같은 모델이 지시문과 기록을 담은 문맥 h(x,τ,v)로부터 K개의 회고를 샘플링한다. 그다음 동일 모델을 다음 토큰 예측 손실로 파인튜닝하는데, 손실은 회고 토큰에만 걸린다. 수식으로는 L = -(1/T_t) Σ Σ log π_θ(y_j | h, y_<j)이며 T_t는 배치 내 회고 토큰 총수다. 과제, 시도한 행동, 관찰, 피드백은 예측 대상에서 마스킹되고 그래디언트는 그 문맥 표현을 통해 흐를 수 있다. 외부 교사도, 보상 기반 정책 업데이트도, 별도의 의미 품질 필터도 없다. 성공한 시도와 실패한 시도 모두 학습 대상이 된다. 결정적으로 이후 시도와 평가에는 저장된 회고 텍스트가 주어지지 않고 추가 회고 단계도 없다. 이득이 있다면 업데이트된 가중치를 통해서만 전이되어야 한다. 저자들은 이 방향을 Retrospection Reinforcement(RR)라 부른다.

무엇과 다른가

실험은 Qwen3.5-4B와 소프트웨어 엔지니어링 과제로 진행됐다. 학습 데이터는 SWE-rebench에서 뽑은 767개 문제(SWE-rebench-767)인데, GRPO에 유리하도록 3회 시도에서 성공과 실패가 섞여 나오는 문제만 남긴 이른바 학습 구역(learning zone) 부분집합이다. 평가는 SWE-bench Verified(500개)와 SWE-bench Pro다. 베이스 모델은 Verified 44.2%, Pro 23.9%였다. ROFT는 20업데이트 체크포인트에서 Verified 49.2%, Pro 29.0%를 기록했고, GRPO는 40업데이트에서 48.0%, 25.3%였다. 다만 초록은 같은 Pro 수치를 26.8%로 적어 원문 안에 불일치가 있다. 효율 차이는 더 크다. 동일한 GPU 4+4 구성에서 ROFT는 40업데이트를 4.32시간, 6,035회 해답 시도로 끝냈고 GRPO는 8.30시간, 11,576회가 걸렸다. ROFT는 10업데이트·1.29시간에 Verified 49.0%를 풀어, 8.30시간이 걸린 GRPO 40업데이트의 48.0%를 넘는다. 약 6분의 1 시간에 더 높은 점수를 낸 셈이다. 반면 GRPO의 학습 보상은 계속 오르는데도 Verified 해결률은 40업데이트 48.0%에서 90업데이트 46.0%로 떨어져 과적합 양상을 보였다.

어떻게 쓰나

가장 눈에 띄는 결과는 모델의 프론티어 너머 학습이다. 베이스 모델이 64회 샘플링에서 한 번도 성공하지 못한 개별 과제(0/64)를 단일 과제로 학습시켰더니, 40업데이트 후 온라인 해결률이 SymPy 1.75%, SymbiFlow 3.29%에 도달했다. 이진 보상만 쓰는 GRPO는 그룹 내 어드밴티지가 0이라 이 영역에서 학습 자체가 불가능하다. 행동 분석도 이를 뒷받침한다. GPT-6 Astra로 정오를 라벨링한 고정 궤적에서, ROFT 10업데이트 후 정답 턴의 로그우도가 오른 비율은 32.41%로 오답 턴 21.21%보다 높았지만 GRPO는 44.14% 대 45.30%로 구분이 없었다. 즉 행동을 직접 지도하지 않았는데도 간접적 크레딧 할당이 일어난다. 회고 프롬프트를 "더 직접적인 해법"을 강조하도록 바꾸면 명시적 길이 페널티 없이 생성 어시스턴트 토큰이 11.7%, 어시스턴트 턴이 13.1% 줄었다. 토큰 역할별 KL 분석에서는 추론이 도구 호출 대비 3.45배 큰 변화를 보였고, Glob·Read 같은 읽기/검색 문맥이 Write·Edit보다 1.35~1.89배 크게 이동했다.

전제와 한계

절제 실험도 촘촘하다. 롤아웃당 회고 4개가 이 스윕에서 가장 좋았고(2·4·8개에 대해 소스 롤아웃 128·64·32개로 명목 배치 256개 고정), Qwen3.5-9B에서도 20업데이트 후 ROFT 58.8% 대 GRPO 55.8%로 우위가 유지되며 학습 시간은 1.93시간 대 5.33시간이었다. 최종 정오 판정을 회고에 넣어주는지 여부는 결과를 바꾸지 않아(둘 다 49.2%) 에이전트 자체 테스트 관찰만으로 충분한 문맥이 된다는 해석을 낳는다. 온라인 RR 49.2%, 회고 생성기만 고정한 off-policy 47.4%, 시도와 회고를 모두 고정한 완전 오프라인 48.0%로, 시도 생성기와 회고 생성기를 계속 정렬해 두는 온라인 방식이 가장 좋았다. 동일한 회고에 가중치만 다르게 준 실험에서는 Attention-up 54.69%, correction-up 54.38%, evidence-up 54.22%가 균일 가중 50.63%를 앞섰다(모델당 640회 시도).

개발자 관점에서 이 논문의 실용적 함의는 명확하다. 검증기(verifier)나 보상 모델을 붙이지 않고, 실패한 롤아웃에서도 학습 신호를 뽑아낼 수 있다는 것이다. 특히 그룹 내 성공이 하나도 없어 GRPO가 아무것도 배우지 못하는 구간에서 회고 학습은 최소한의 진전을 만든다. 또 회고 프롬프트에 무엇을 강조하라고 쓰느냐가 이후 행동(해결 속도, 탐색 패턴)을 바꾼다는 관찰은, 프롬프트 엔지니어링이 추론 시점을 넘어 학습 목표 자체를 조종하는 손잡이가 될 수 있음을 시사한다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, 학습 구역 선별이 성능에 큰 영향을 주므로 자기 워크로드에서 성공/실패 혼합 비율을 먼저 측정해야 한다. 둘째, 회고 내용의 품질을 걸러내는 장치가 없다는 점이다. 셋째, 이득이 회고 텍스트를 추론 시 제공하는 방식(Reflexion류)과 어떻게 상호작용하는지는 이 논문이 다루지 않는다.

저자들이 밝힌 한계는 분명하다. 실험은 소프트웨어 엔지니어링과 Qwen3.5-4B에 집중되어 있어 범위가 넓지 않다. 비용 문제도 구체적으로 제시한다. 40업데이트 GRPO 학습 1회에 약 500달러, SWE-bench Pro 평가 1회에 GPU 비용만 200달러가 든다. ROFT는 최적성이 아니라 단순성 때문에 선택한 방법이며, 더 큰 규모의 통제된 연구로 인과 기제를 규명해야 한다고 말한다. 행동 분석에 쓰인 궤적 턴 정오 라벨과 회고 구간 주석은 GPT-6 Astra의 모델 판단이지 독립적으로 감사된 정답이 아니다. 자기 생성 회고는 잘못된 설명이나 편향된 가정을 강화할 수 있고, 모델 내부 추론의 충실한 기록으로 취급해서는 안 된다. 벤치마크 테스트 통과가 안전성이나 신뢰성을 입증하지도 않는다.