사용자 시뮬레이터 MIMESIS로 대화형 에이전트 훈련 환경을 만든다
MIMESIS: Learning User Simulators as Training Environments for Interactive Agents
무엇인가
대화형 언어 에이전트는 여러 턴에 걸친 상호작용으로 평가되고 훈련되지만, 사람 사용자 피드백은 비용이 크고 재현과 확장이 어렵다. 그래서 흔히 어시스턴트 LLM을 프롬프트로 역할극시켜 사용자 대신 쓴다. 논문은 여기서 생기는 불일치를 문제로 지목한다. 어시스턴트 모델은 도움을 주도록 최적화되어 있어 실제 사용자보다 지나치게 협조적이고 명시적이며 행동이 균질하다는 것이다. τ-bench에서 고정된 GPT-5.5 에이전트는 실제 사용자와의 상호작용에서 63.6% 성공하지만, 프런티어 API 시뮬레이터를 붙이면 성공률이 82.4~84.4%로 올라가고, 사전학습된 Qwen3.5-4B/9B를 붙이면 각각 16.0%p, 14.9%p 떨어진다. 반면 목적에 맞게 훈련된 시뮬레이터는 편차가 최대 10.3%p로, 모든 사전학습 모델(최소 14.9%p)보다 작다. 시뮬레이터가 훈련·평가 궤적의 분포 자체를 결정하기 때문에, 표면적 자연스러움만으로 품질을 판단할 수 없다는 것이 저자들의 출발점이다.
어떻게 동작하나
1단계는 사용자 시뮬레이터 MIMESIS를 만드는 과정이다. Qwen3.5 백본의 4B와 9B 모델에 같은 절차를 적용한다. 먼저 사람-어시스턴트 대화로 사용자 역할 중간학습을 하고, ThoughtTrace(사용자가 스스로 보고한 메시지 발송 이유와 어시스턴트 응답에 대한 반응)를 붙여 사고 증강 지도학습을 한다. 공개 발화 앞에 비공개 추론 트레이스를 감독하는 방식이며, 이 트레이스는 에이전트에게 돌려주지 않는다. 이어서 SOUL 환경들에 걸친 공동 다중도메인 강화학습(GRPO)을 수행하는데, 여기에 현실적 행동 과제를 별도 도메인으로 섞는다. ThoughtTrace에서 반복적으로 나타난 패턴으로 13가지 현실적 사용자 행동(숨은 평가 기준, 점진적 목표 이동, 명확화 질문 비협조 등)을 분류하고, ABCD 고객지원 시나리오에서 이를 실제로 표현하도록 훈련한다. 보상은 목표 행동의 표현 여부, 대화 내 시점 적절성, 자연스러움, 과제 일관성 네 가지 점수를 합치고, 행동을 상호작용으로 표현하지 않고 설명만 하는 응답에는 감점을 준다.
무엇과 다른가
2단계는 학습된 시뮬레이터를 동결하고 에이전트를 훈련하는 것이다. UserRL 방식을 따라 다중턴 GRPO로 과제 보상을 최적화하되, 여기에 Coached On-Policy Self-Distillation(CSD)을 더한다. 코칭 모델 G가 공개 히스토리, 샘플링된 에이전트 응답, 시뮬레이터의 사고, 그에 따른 다음 사용자 발화를 입력받아 짧은 코칭 노트를 만든다. 같은 응답을 두 문맥에서 채점하는데, 학생은 공개 히스토리만 보고 교사는 코칭 노트를 추가로 본다. 두 로그확률의 차이에 시그모이드와 stop-gradient를 적용해 0과 1 사이 토큰 가중치를 만들고, 가중 로그가능도 손실로 학생을 업데이트한다. 최종 목적함수는 GRPO 손실에 가중치 α를 곱한 CSD 손실을 더한 형태다. 코칭 노트는 응답 생성 이후에 회고적으로 만들어지고, 배포 시 에이전트는 공개 대화만 조건으로 응답한다.
어떻게 쓰나
시뮬레이터 자체의 평가에서 MIMESIS-9B는 SOUL-Index 65.7로 Claude-Opus-5(64.9), GPT-5.5(64.1), 공개 시뮬레이터 중 최강인 Osim-8B(58.8)를 앞선다. 4B도 63.7로 공개 시뮬레이터 전부를 넘고, 각 백본 대비 15.2점과 18.0점을 올렸다. 대화 시뮬레이션 축에서는 9B 75.1, 4B 74.4로 최강 베이스라인 Ditto-8B(61.7)를 13.4점, 12.7점 차로 앞선다. RealUserSim PT3의 충실도 지수는 9B 94.0으로 Claude-Opus-5(80.6)보다 13.4점 높고 4B는 89.7이다. 상호작용·정보 흐름(91.3 대 69.5)과 페이싱(91.2 대 72.5)에서 격차가 크며, 페르소나 점수는 GPT-5.5 99.3, MIMESIS-9B 99.4로 이미 천장에 가깝다. SimulatorArena에서는 Turing distance를 3.6점 줄였다.
전제와 한계
에이전트 전이 실험은 8개 Gym 환경(3개는 훈련에서 제외)과 9개 평가 사용자 모델(모두 훈련 시뮬레이터와 다름)에서 이뤄졌다. GRPO 목적을 고정한 채 GPT-5.5를 MIMESIS-9B로 바꾸면 평균 점수가 26.10에서 29.54로 오르고, 9개 평가 사용자 전부에서 향상된다. 개선폭은 Claude-Opus-5에서 1.46점, Gemini-3.8-Flash에서 4.55점 사이다. 여기에 CSD를 더하면 평균이 31.09로 다시 오르며, 동일한 동결 시뮬레이터를 쓴 100 스텝 구간에서 CSD 곡선이 GRPO 위에 계속 머문다.
실무적으로 이 논문이 주는 판단 기준은 두 가지다. 사용자 시뮬레이터를 고를 때 대화가 자연스러운지만 보지 말고, 실제 사용자가 만드는 상호작용 난이도를 보존하는지 확인해야 한다. 그리고 그 시뮬레이터로 훈련한 정책이 다른 사용자 모델로 교체했을 때도 성능이 유지되는지를 봐야 한다. 자체 에이전트 RL 파이프라인을 운영한다면, 범용 어시스턴트 LLM을 프롬프트로 사용자 역할극시키는 대신 도메인 대화 로그로 사용자 역할을 파인튜닝하고 사고 트레이스를 감독하는 선택지가 있다. CSD는 스칼라 과제 보상만으로는 잡히지 않는 토큰 수준 신호를 주면서도 배포 시 추가 추론 비용이 들지 않는다는 점이 실용적이다.
저자들이 밝힌 전제와 한계도 분명하다. 시뮬레이터의 사고와 반응은 모델이 생성한 피드백이며, 사람 사용자의 내부 상태를 관측한 것이 아니다. 코칭 노트는 응답이 샘플링된 뒤 회고적으로 만들어지므로 응답 생성 시점에는 존재하지 않는다. CSD는 코칭 교사가 학생보다 낮은 확률을 준 토큰을 직접 벌하지 않고 가중치를 약하게 줄 뿐이다. 또한 시뮬레이터는 에이전트 최적화 동안 동결되어 함께 갱신되지 않는다.