에이전트 자기개선은 성능이 아니라 학습 효율로 재야 한다

Agent Plasticity: Measuring Self-Improvement Through Experience

HF Daily2610.08902

Harman Singh, Anton Bakhtin, Rulin Shao2026-10-06조회 1

무엇인가

대부분의 에이전트 평가는 특정 시점에 그 에이전트가 무엇을 할 수 있는지를 잰다. 그런데 실제 에이전트는 실패를 진단하고, 도구를 만들고, 메모리를 쌓고, 재사용 가능한 스킬과 전략을 다듬으면서 행동을 바꾼다. 오늘 성능이 비슷한 두 에이전트도 같은 학습 기회를 준 뒤에는 전혀 다른 궤적을 그릴 수 있다. 이 논문은 그래서 평가 질문을 셋으로 쪼갠다. 학습을 가능하게 한 상호작용 너머로 성능이 일반화되는가, 새 능력을 얼마나 효율적으로 습득하는가, 그리고 자기개선 루프는 어디서 끊어지는가.

어떻게 동작하나

저자들이 쓰는 프로토콜은 모델 가중치를 고정한 '고정 가중치 에이전트 계보(agent lineage)'다. 체크포인트 t의 에이전트는 고정된 언어 모델 M과, 실행 가능한 파이썬 도구·자연어 전략과 스킬·텍스트 메모리로 구성된 영속적 자산 목록 I_t로 이루어진다. 각 행동 에피소드는 매번 새 컨텍스트에서 시작하고 대화 기록이나 임시 파일은 남지 않는다. 학습 에피소드가 궤적·결과·실행 트레이스·오류·수 품질 피드백 같은 증거를 만들면, 같은 모델이 반성(reflection) 단계에서 현재 목록과 증거를 받아 I_{t+1} = U_M(I_t, E_train_t) 로 갱신을 제안한다. 제안된 갱신은 구조 검사와 실행 검사를 통과해야 영속화되고, 거부된 시도는 목록을 바꾸지 않지만 이후 시도에 참고가 될 수 있다. 거부 한도를 소진하면 이전 목록이 유지되며, 학습 비용에는 거부된 시도도 포함된다.

무엇과 다른가

평가는 세 갈래로 나뉜다. 궤적과 피드백이 반성 단계에 노출되는 학습 상호작용, 같은 난이도 체제의 홀드아웃 ID 상호작용, 더 강한 상대와 붙는 홀드아웃 OOD 상호작용이다. 홀드아웃 궤적과 점수는 반성 단계에 절대 노출되지 않는다. 학습 비용은 환경 상호작용과 자산 수정에 들어간 모델 호출을 모두 합산해 달러로 환산한 값 C_{m,e,t}이고, 논문이 도입하는 agent plasticity는 홀드아웃 성능 향상을 이 비용으로 나눈 값 P = (S_T − S_0)/C_T, 즉 학습 비용 1,000달러당 점수 상승폭이다. 헤드라인 지표는 포화까지의 효율이다. 각 곡선을 S(C) = S_0 + A·C^h/(C^h + C_50^h) 꼴의 단조 함수로 이항 최대우도로 적합하고, 적합 곡선이 상승분의 90%에 도달하는 첫 체크포인트의 비용 C*를 찾아 P_sat = (S(C*) − S_0)/C* 를 계산한다. 적합된 90% 상승폭이 10퍼센트포인트 미만이면 P_sat = 0으로 두고, 관측된 체크포인트가 임계값에 닿지 않으면 마지막 관측 비용의 최대 3배까지 외삽한다.

어떻게 쓰나

실패 진단은 개선 루프를 세 단계로 분해한다. 어떤 결정 실패에 대해 덮어줄 자산이 아예 없었는지(F_absent), 있었는데 쓰이지 않았는지(F_missed), 썼는데도 실패가 남았는지(F_used)를 구분한다. 실패에 조건화된 이 분류와 별개로, 관련 자산이 존재하는 '관련 결정' 중 실제로 자산이 쓰인 비율인 결정 수준 재사용률도 측정한다. 판정은 Gemini 3.1 Pro의 의미 판단과 파일 읽기·파이썬 호출 같은 실행 증거를 결합해 내리며, 저자들은 이 진단이 관찰적이어서 인과를 확립하지는 않는다고 명시한다.

전제와 한계

실험은 체스, 5x5 바둑, 6x6 헥스, NetHack에서 이뤄졌다. 체스는 체크포인트 0의 맨 하네스에서 시작해 20라운드 갱신하며, 매 체크포인트마다 학습 16판, 홀드아웃 ID 12판, 홀드아웃 OOD 12판을 두고 Stockfish는 수당 탐색 노드 2만 개로 제한했다. 점수는 100(W + 0.5D)/N이고, 예산을 소진하거나 수를 내지 못한 판은 패배로 계산한다. Hard 체스에서 Claude Fable 5의 홀드아웃 ID 점수는 체크포인트 0의 37.5%에서 16~20 구간 평균 73.3%로, Claude Opus 5는 25.0%에서 66.4%로 올랐다. GPT-5.6 Sol은 거의 0%에서 시작해 36.9%까지 약진했지만 절대 점수에서는 뒤처진다. Claude Opus 4.8은 주로 Easy 조건에서 0%에서 19.0%로 소폭 개선됐고, 여러 모델은 초기 성능 근처에 머물거나 오히려 하락했다. 바둑에서는 Claude Fable 5가 홀드아웃 ID 20%→80%, OOD 0%→50%로 뛰었고, 헥스에서는 GPT-5.6 Sol이 ID 40%→77.5%, OOD 28.1%→78.1%로 올랐다. 반면 Claude Opus 4.8은 바둑에서 후퇴하면서 헥스에서는 크게 개선되는 등 과제 의존성이 뚜렷했고, Claude Opus 5는 바둑에서 크게 오르다 마지막 체크포인트의 도구 제작 오류로 성능이 급락했다. NetHack(체크포인트 0~40, 매 체크포인트마다 동일한 미공개 10판)에서는 Claude Opus 5.5가 평균 점수 약 2천에서 약 6천으로 올라 체크포인트 11에서 포화에 도달했고 P_sat = 61.75를 기록한 반면, GPT-5.6 Luna는 약 210에서 120으로, GPT-5.6 Sol은 약 570에서 420으로 하락했다.

핵심 발견은 최종 성능과 습득 효율이 서로 다른 질문에 답한다는 것이다. 체스(Hard·Easy)·바둑·헥스를 동등 가중으로 합친 곡선에서 GPT-5.6 Sol의 P_sat가 학습 비용 1,000달러당 298퍼센트포인트로 가장 높고, Claude Opus 5가 233, Claude Fable 5가 57, Claude Opus 4.8이 14였으며 GPT-5.6 Luna는 신뢰할 만한 상승이 없어 0으로 처리됐다. GPT-5.5는 런이 끝날 때까지 느리게 개선 중이어서 포화를 확정할 수 없었다. 최고 적합 성능에 도달한 것은 Claude Fable 5였고, GPT-5.6 Sol은 Claude Opus 4.8보다 낮은 초기 성능에서 출발해 홀드아웃 성능과 추정 plasticity 모두에서 이를 앞질렀다. 즉 최종적으로 가장 잘하는 에이전트가 가장 효율적으로 개선하는 에이전트일 필요는 없다.

실패 루프 분석은 병목이 모델마다 다르다는 것을 보여준다. Hard·Easy 체스를 합산하면 GPT-5.6 Luna는 관련 결정의 약 98%를 자산 사용 없이 처리했고 Gemini 3.1 Pro는 약 87%, Claude Opus 4.6은 약 51%, GPT-5.5는 약 28%였던 반면, Claude Fable 5·Claude Opus 5·Claude Opus 4.8·GPT-5.6 Sol은 2~6%에 그쳤다. 체스(Hard)·바둑·헥스의 19개 모델-게임 조합에서 홀드아웃 ID 재사용률은 체크포인트 0 대비 16~20 구간의 홀드아웃 ID 점수 상승과 상관을 보였다. 그러나 재사용률이 높다고 성능이 설명되지는 않는다. 자산을 관련 결정의 94~98%에서 재사용하는 네 모델이 서로 크게 다른 점수를 냈고, 강한 개선자들도 남은 실패의 83~99%는 자산을 쓰는 도중에 발생했다(관련 결정당 식별 실패 0.16 대 다른 모델 0.38). 재사용은 성능 정점보다 먼저 오르기도 하고(GPT-5.6 Sol과 Claude Opus 4.8은 체크포인트 3에서 93~99%까지 오르지만 점수 정점은 각각 12와 5), 개선 없이 패턴만 바뀌기도 한다. Claude Opus 4.6은 자산 사용에도 실패하는 비율이 6.5%에서 52%로 올랐지만 관련 결정당 실패 수는 0.42에서 0.41로 평평했고, GPT-5.5는 Hard 체스에서 자산이 바뀌지 않았는데도 체크포인트 9 이후 재사용률이 96~100%에서 32~50%로 떨어졌다. 바둑에서 Claude Opus 4.8은 성공적 재사용 비율을 59~65%에서 93%로 끌어올리는 동안 홀드아웃 ID 점수는 40%에서 10~25%로 하락했다.

개발자 입장에서 이 논문이 주는 실무적 시사점은 분명하다. 에이전트를 오래 운영하는 시스템이라면 배포 시점의 벤치마크 점수만으로 모델을 고르지 말고, 같은 학습 예산을 주고 홀드아웃 성능이 얼마나 오르는지를 봐야 한다. 또한 자산 재사용률 같은 대리 지표를 성능의 증거로 삼으면 안 된다. 재사용률이 높아도 자산의 품질·일반성·적용 방식이 나쁘면 실패는 그대로 남고, 반대로 재사용률이 낮으면 검색·배포 계층을 먼저 손봐야 한다. 논문이 든 구체적 사례도 이를 뒷받침한다. 한 Claude Fable 5 계보는 외부 라이브러리 없이 자체 체스 엔진을 작성하고, 킹이 공격받은 실수 뒤에는 체크를 벗어나는 수를 탐색하는 로직을, 이긴 포지션을 날린 뒤에는 반복 국면 처리를, 엔드게임에서 앞서고도 못 이긴 뒤에는 엔드게임 탐색 시간을 추가하는 식으로 특정 실패에 대응해 엔진을 고쳐 나갔다. 반대로 한 GPT-5.5 런에서는 반성 단계가 저장된 수 선택 프로그램을 즉시 불러오라고 계속 지시하는데도 에이전트는 첫 단계에서 파일을 나열하고 읽는 데 시간을 썼다. 지시를 적어 두는 것과 그것을 따르는 것은 다르다.

저자들이 밝힌 한계도 분명하다. plasticity는 특정 학습 프로토콜 아래의 에이전트 속성이지 모델 고유의 스칼라 값이 아니며, 긴 컨텍스트 지시 수행 능력이 자산 구축·적용에 기여하는 몫은 이 실험으로 분리되지 않았다. 새 컨텍스트와 고정 가중치는 영속적 적응을 자산으로 한정하지만, 환경 피드백의 가치와 경험을 분석·수정하는 데 드는 추가 연산을 분리하지는 못한다. 별도로 학습된 계보들은 과제 간 전이를 입증하지 못하고, 평가 집합이 유한해 체크포인트 수준 잡음이 끼며, plasticity 추정치는 점수 상한 여유, 학습 지평, 포화 적합 가정, 제공자 가격에 의존한다. 그래서 저자들은 작은 plasticity 차이를 보편적 모델 순위로 해석하지 말고 전체 학습 곡선과 함께 보고하라고 권한다. 마지막으로 이들은 plasticity 자체를 사후학습의 목표로 삼을 수 있다고 제안한다. 즉시 성능만 보상하는 대신, 배포 이후 새로운 능력을 더 효율적으로 습득하도록 만드는 훈련 목표를 설계하는 방향이다.