툴 호출과 요약을 분리해 크레딧 오귀속을 없앤 SLCA-GRPO
SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL
무엇인가
툴 호출 에이전트의 출력은 성격이 다른 두 덩어리가 번갈아 나온다. 추론 흔적과 구조화된 API 호출로 이루어진 실행 구간(y_tool)과, 사용자에게 보여줄 자연어 최종 답변 구간(y_sum)이다. 이 논문이 지적하는 문제는 표준 on-policy RL 알고리즘, 특히 GRPO가 궤적 전체에 대해 계산한 단일 스칼라 어드밴티지를 모든 토큰에 무차별적으로 뿌린다는 점이다. 그 결과 요약 생성에서 나온 그래디언트 노이즈가 툴 결정 토큰으로 새어 들어가 실행 구간의 학습을 흔든다. 저자들은 이를 크로스 세그먼트 크레딧 오귀속(cross-segment credit misattribution)이라 부르고, 원인을 그래디언트 방향 충돌이 아니라 어드밴티지 오염(advantage contamination)이라는 구조적 결함으로 규정한다. 부호가 엇갈리는 상황에서는 실패한 툴 호출이 뒤따르는 정확한 요약 덕분에 강화되거나, 올바른 툴 궤적이 잘못된 요약 때문에 벌점을 받을 수 있다. 기존 완화책들도 이 경로를 닫지 못한다고 본다. VinePPO·GiGPO·SPO 같은 시간축 방법은 여전히 R_total을 쓰고, ToolPO는 로컬 툴 보상을 더하지만 요약 의존 노이즈가 툴 토큰까지 도달하며, RLTR은 플래너와 요약기를 분리해 단일 백본을 포기한다.
어떻게 동작하나
제안 방법 SLCA-GRPO의 핵심은 Segment-Locked Credit Assignment(SLCA)다. 먼저 그래디언트 마스크 m_i,t로 학습 가능한 정책 토큰과 동결된 환경 컨텍스트를 구분하고, 이 마스크를 이용해 별도 세그먼터 학습 없이 궤적을 자동 분해한다. 학습 가능한 토큰의 마지막 연속 구간이 요약 세그먼트, 그 앞의 모든 학습 가능 구간의 합집합이 툴 세그먼트가 된다. 다음으로 Hierarchical Rewards(HierR)가 보상을 두 갈래로 나눈다. R(y) = R_tool(y_tool) + R_sum(y_sum | y_tool, o) 형태로, 툴 정확성과 효율을 보는 밀집 프로세스 보상과 최종 답변 품질을 보는 종단 요약 선호 점수를 각각 계산한다. 이 두 세그먼트 보상을 그룹 내에서 따로 정규화해 Â_tool과 Â_sum을 만들고, 툴 토큰에는 툴 어드밴티지만, 요약 토큰에는 요약 어드밴티지만 배정한다(마스크가 0인 토큰은 0). 중간 상태에서 추가 롤아웃을 뽑을 필요가 없고, 모델을 쪼개지도 않으며, 스칼라 어드밴티지 배정만 바꾼다. 저자들이 제시하는 이론적 성질은 어드밴티지 격리, 즉 툴 토큰 그래디언트 성분이 요약 보상에 대해 함수적으로 독립(∂g_tool/∂R_sum = 0)이라는 것이다. 요약 노이즈 분산 항을 툴 업데이트에서 제거하고 부호 충돌 상황에서도 툴 실행 방향을 보존한다는 분석이지만, 전역적 무편향 최적화가 아니라 업데이트 단위의 조건부 보장이라고 스스로 한정한다.
무엇과 다른가
학습 인프라로는 Schema-Guided LLM Simulator(SGLS)를 먼저 구축한다. 실제 API 호출은 RL 규모에서 비싸고 불안정하기 때문에, 결정적 스키마 검증과 동결된 교차 계열 LLM 모킹을 결합해 잘못된 호출에는 즉시 구조화된 피드백을, 유효한 호출에는 그럴듯한 툴 응답을 돌려준다. 최종 목적함수는 GRPO의 단일 스칼라 어드밴티지를 라우팅된 세그먼트 어드밴티지로 교체한 PPO-clip이며, 토큰별 KL 페널티를 함께 건다. 구현에는 희소 툴 상황을 위한 존재 필터링, 정규화 후 가중치, 누락 페널티 라우팅이 들어간다.
어떻게 쓰나
실험은 Qwen2.5-3B-Instruct, Qwen2.5-7B-Instruct(기본), Qwen3-8B-Base 세 백본에서 진행한다. 인도메인은 Toucan-1.5M으로, 필터링을 거쳐 SFT 42,423건과 RL 학습 31,818건을 만들고 4,000건 홀드아웃으로 평가한다. 일반화는 BFCL V3(단일 턴, 관련성 탐지 제외), 협업 견고성은 τ²-Bench(Airline·Retail·Telecom, Pass^1)로 측정한다. 베이스라인은 원본 백본, SFT(Toucan), SFT+GRPO, ToolPO, RLTR(적응)이다. 핵심 통제 비교인 SFT+GRPO와 SFT+SLCA-GRPO는 데이터 분할, SFT 초기화, SGLS 엔드포인트, 모커 설정, 디코딩, 평가 프로토콜, 롤아웃 그룹 크기 G=16, RL 1에폭, HierR 보상을 모두 공유하고 통합 어드밴티지 대 세그먼트 잠금 어드밴티지만 다르다. 7B에서 Toucan strict [email protected]는 3회 실행 평균 79.13%로 매칭 GRPO보다 2.53pp 높고, 같은 격차가 3B에서 +2.35pp, 8B에서 +2.05pp다. BFCL은 7B +1.36pp, 3B +0.40pp, 8B +3.35pp이며, Qwen3-8B-Base에서 SLCA가 70.31±0.50%로 매칭 GRPO 66.96±0.32%, SFT 68.50±0.35%를 앞선다. τ²-Bench는 3B +1.09pp, 7B +9.15pp, 8B +10.03pp(모두 3회 평균)다.
전제와 한계
학습 동역학도 함께 보고한다. SLCA-GRPO는 세 백본 모두에서 표준 GRPO보다 평균 툴 턴 수가 적으면서 성공률이 높게 끝난다. 반면 표준 GRPO는 성공률 이득 없이 궤적만 길어지는데, 저자들은 이를 요약 보상을 이용하려 궤적을 늘리는 수행적 실행(performative execution)으로 해석한다. 7B ToolPO 곡선은 40스텝 이후 하락하고 80스텝 이후 구조적 발산이 나타난다고 기술한다. 절제 실험에서는 SLCA를 빼고 통합 어드밴티지로 되돌리면 7B Toucan 성공률이 2.53pp 떨어지고, SGLS를 제거하면 OOD 전이 지표가, HierR을 제거하면 희소 요약 보상만 남아 수렴이 느려지고 복잡한 질의에서 인자 정렬이 나빠진다. 보상 민감도 검사로 골드 호출 매칭 없는 이진 R_succ 판정과 GPT-OSS-120B 응답 모커 조합도 확인한다.
개발자 관점에서 이 논문의 실용적 메시지는 명확하다. 툴 호출과 사용자 응답을 한 궤적으로 생성하는 에이전트를 GRPO 계열로 학습시킨다면, 보상을 합산해 하나의 어드밴티지로 정규화하는 순간 요약 쪽 분산이 툴 정책 업데이트에 섞여 들어간다. SLCA는 추가 롤아웃이나 별도 모델 없이 토큰 구간별로 어드밴티지를 따로 정규화해 배정하는 것만으로 이 경로를 막는다. 다만 이는 툴 호출이 최종 답과 인과적으로 무관하다는 주장이 아니라, 밀집 실행 보상이 툴 결정 토큰 갱신에 더 낮은 분산의 충분한 신호라는 편향-분산 트레이드오프를 받아들이는 설계다. 또한 SLCA가 다루는 축은 실행 대 발화라는 구조적 축이며, ReAct 체인 내부의 Action 1 대 Action 2 같은 시간적 크레딧 배정과는 직교하므로 VinePPO·GiGPO·SPO와 조합 가능하다고 저자들은 말하지만, 조합 자체를 실험으로 검증하지는 않았다.
한계도 저자들이 직접 밝힌다. SLCA는 툴 호출과 자유 형식 텍스트 사이에 명확한 경계가 있다고 가정하므로, 인라인 코드 생성처럼 경계가 없는 설정에는 학습된 세그먼터가 필요하다. 프로세스 보상 S_process는 골드 궤적 매칭에 의존해 하나의 요청을 푸는 여러 유효한 API 계획을 과소 보상할 수 있고, Toucan의 strict [email protected]는 독립적인 과업 결과 라벨이 아니라 이 점수를 임계값으로 자른 것이다. 요약 어드밴티지 Â_sum은 요약 토큰에 그룹 편향을 물려받는데, 명시적 서브그룹핑은 그룹 크기를 지수적으로 줄인다. 툴 세그먼트 내부의 시간적 크레딧은 다루지 않아 모든 툴 토큰에 하나의 스칼라 Â_tool을 주므로 올바른 Action 1과 실패한 Action 2를 구분하지 못한다. 실험 규모도 SGLS를 쓴 최대 8B까지이며, 더 큰 규모의 학습과 실제 API 직접 비교는 향후 과제로 남긴다.