사용자 정신 상태 시뮬레이션으로 인간 인지형 언어 모델을 훈련하는 Mind2Dialogue
Mind2Dialogue: Training Human-Aware Language Models by Simulating User Mental States
무엇인가
언어 모델이 학습과 추론, 의사결정을 장기적으로 돕기 위해서는 사용자가 말하지 않은 믿음과 목표, 처지를 이해해야 한다. 그런데 논문은 여기서 근본적인 지도(supervision) 공백을 지적한다. 서로를 잘 아는 사람끼리의 대화는 상대의 사정을 반영한 도움의 자연스러운 예이지만, 사적 대화를 대규모로 모으려면 동의와 막대한 주석 작업이 필요하다. 공개 대화 코퍼스는 규모가 크지만 사용자의 변화하는 내부 상태를 직접 관찰할 수 없어, 표면적인 대화만으로는 어시스턴트가 말하지 않은 믿음과 목표를 추론해 행동하도록 가르치기 어렵다. 페르소나 조건부 생성은 정적인 프로필에 머물러 믿음·목표·감정의 변화를 대화 안에 암묵적으로 남기고, LLM 사용자 시뮬레이터는 현실감은 높여도 교사 모델이 대화에서 상태를 추론하다 생긴 오류가 응답 목표에 섞여 들어가는 문제가 있다.
어떻게 동작하나
논문이 제안하는 Mind2Dialogue의 핵심은 공유 상태 사용자 시뮬레이션(shared-state user simulation)이다. 페르소나 p와 함께 하나의 진화하는 상태 s_t를 사용자 행동 생성과 어시스턴트 응답 생성 양쪽에 공유한다. 매 턴 상태 갱신 정책이 s_t ~ π_state(·|p, s_{t-1}, H_{<t})를 만들고, 사용자 시뮬레이터가 m_t ~ π_user(·|p, s_t, H_{<t})로 발화하며, 오라클 어시스턴트가 a_t ~ π_oracle(·|p, s_t, H_t)로 응답 목표를 생성한다. 여기서 H_t = (H_{<t}, m_t)는 사용자 메시지까지의 대화 이력이다. 오라클은 사용자 행동을 만들어낸 상태를 직접 보므로 대화에 부분적으로만 드러난 믿음과 목표, 감정에 근거한 응답을 시연할 수 있다. 학생 모델의 입력 x_t는 H_t를 포함하되 s_t를 제외한다. 논문은 이 정보 비대칭이 정신 상태를 학습의 안내로 쓰면서도 배포 시점에는 그 상태를 입력으로 요구하지 않게 해준다고 설명한다.
무엇과 다른가
M2D-Sim 시뮬레이터는 심리학 이론에 기대어 설계됐다. 시나리오가 상호작용의 즉각적 맥락을 제공하고, s_t는 턴을 넘어 유지되는 시뮬레이터 정의 변수를 기록하며, 동적 행동 모드 프롬프팅이 매 턴 사용자의 행동 방식을 제어한다. 시나리오는 평생(lifelong), 고빈도(high-frequency), 정서(affective)의 세 범주로 만들고, 추상화 수준과 기존 시나리오와의 임베딩 유사도(코사인 유사도가 θ_sim을 넘으면 기각), 페르소나와의 의미적 일관성으로 후보를 거른다. 상태는 s_t = (c_t, z_t^stable, z_t^transient) 구조로, c_t는 턴 인덱스와 미해결 목표, 신뢰 이력, 상호작용 요약을 담고, z_t^stable은 가치관과 배경 제약, 어시스턴트에 대한 태도처럼 천천히 변하는 정보를, z_t^transient는 기분과 현재 걱정, 턴 중 판단처럼 짧게 사는 정보를 담는다. 행동 제어기는 사용자 니즈와 행동 분류체계(TUNA)를 바탕으로 14개 모드와 2개 폴백 모드를 사용하며, 정보 탐색과 정보 처리, 절차 안내, 콘텐츠 생성, 사회적 상호작용, 메타 대화의 여섯 계열을 고루 덮도록 선택한다.
어떻게 쓰나
코퍼스는 두 관점을 담는다. 대화 관점은 학생이 볼 수 있는 맥락과 오라클 응답을 짝지은 (x_t, a_t) 예시이고, QA 관점은 페르소나와 저장된 상태 궤적, 대화 발췌로 만든 질문-답변 예시로 페르소나 기억 객관식, 자유형 선호 추종, 선호 분류 문제를 포함한다. 생성된 대화는 스키마 유효성, 구조적 정상성(턴 수와 역할 교대, 토큰 범위), 상태 궤적 완전성, 프로필 결속의 네 가지 프로그램 검사와, 시뮬레이터·오라클과 다른 심판 모델을 쓰는 페르소나 일관성 및 고정 속성 충돌 검사를 통과해야 남는다. 학습은 특권 상태 지도 증류로 이뤄진다. 학생 정책 π_φ를 학생이 보는 입력 x와 목표 응답 y에 대해 표준 자기회귀 교차엔트로피 L_SFT(φ) = -E_{(x,y)~M2D-Corpus}[Σ_{j=1}^{|y|} log π_φ(y_j | x, y_{<j})]로 미세조정하되, 손실에는 목표 응답 토큰만 기여한다. 논문은 이 목표의 최적해가 π*(·|x) = q̄(·|x) = E_{s~q(·|x)}[q(y|x,s)]라고 정리한다. 특권은 응답 목표를 만드는 데 쓰인 상태 정보에 있고, 학생은 관찰 가능한 증거만으로 그 결정을 배운다.
전제와 한계
실험은 289개 페르소나로 돌린 M2D-Sim에서 나온 코퍼스 가운데 6,330개 멀티턴 대화를 분석한다. 시나리오는 47개 범주로 정서 1,428개, 고빈도 2,020개, 평생 2,882개이며 상위 9·18·28개 범주가 각각 약 52%, 81%, 96%를 차지하는 롱테일 분포다. 페르소나 특화 값은 153개로 10개 군집으로 묶인다. SFT 혼합물은 8,244개 예시(대화 3,312개 + QA 4,932개)이고, 백본은 Qwen2.5-7B-Instruct를 주로 쓰고 Llama-3.1-8B-Instruct와 OLMo-3-7B-Instruct로 확장성을 확인한다. 1/8, 1/4, 1/2, 전체의 네 비율로 LoRA와 4비트 양자화, 응답 토큰만 마스킹하는 방식으로 학습한다. 시뮬레이션 품질 파일럿에서 M2D-Sim은 구조적 상태 유지와 행동 지침을 생략한 Vanilla보다 후반 턴에서 더 큰 차이를 보였고, 사용자 페르소나 구체성 효과크기는 20턴에서 d=0.66, 주제 깊이는 첫 5턴 d=0.16에서 첫 30턴 d=1.22로 커졌다. 1,240개 대화를 사람이 감사한 결과 1,216개(98.06%)가 통과했다.
개인화 벤치마크(PersonaMem-v1, PersonaMem-v2, PrefEval)에서 전체 혼합물이 세 백본 모두 모든 지표에서 최고였고, 선호 추종 생성(PrefEval-Gen)이 26.6~40.9%포인트로 가장 크게 올랐다. Qwen2.5-7B는 PrefEval 생성에서 33.4%포인트, PersonaMem-v2 객관식에서 10.0%포인트 개선됐다. Qwen 기반 M2D-Chat은 비교표의 네 열 모두에서 비독점 모델 중 최고 점수를 냈는데, PrefEval 생성 56.8은 가장 강한 과제 특화 베이스라인 HumanLM보다 13.2%포인트 높다. PersonaMem-v1·v2에서는 Mem0 메모리 증강이 베이스를 끌어올렸지만 M2D-Chat에 각각 2.1, 2.2%포인트 못 미쳤다. PrefEval 분류는 78.9 대 78.5로 차이가 0.4%포인트뿐이라 논문은 강한 우위를 주장하지 않는다. M2D-Chat은 GPT-4o-mini를 네 평가 중 셋에서 앞섰지만 GPT-5-mini에는 네 번 모두 뒤졌다. 한편 Qwen의 PrefEval 분류는 62.0에서 78.9로, Llama의 PersonaMem-v2 생성은 33.9에서 45.6으로, 객관식은 23.9에서 37.5로 올라 답 선택과 응답 생성 양쪽이 개선됐다.
마음이론에서는 Qwen의 BigToM Forward Belief가 31.0에서 44.0, Forward Action이 23.5에서 31.0으로 올라 AutoToM과 ThoughtTracing의 개선폭을 넘었고(ToMi에서는 두 베이스라인이 더 많이 개선됐다), Llama는 Forward Belief 18.5에서 43.3, Forward Action 39.5에서 57.3, ToMi 63.6에서 70.6을 기록했다. Llama는 1/4 데이터만으로도 PrefEval 생성 56.0, Forward Belief 36.4, Forward Action 51.0을 달성해 베이스 대비 31.5, 17.9, 11.5%포인트를 얻었다. 대화 예시만, QA 예시만, 전체 혼합물을 비교한 Llama 실험에서 대화만 쓴 경우 ToM 평균이 40.5에서 46.3으로 오르고 생성 과제에서 최고였으며, QA만 쓴 경우 PersonaMem-v2 객관식이 가장 높았지만 생성 점수는 원래 모델보다 떨어졌다. 전체 혼합물은 ToM 평균 57.1로 가장 높으면서 생성 성능도 대화 전용에 가깝게 유지했다. 다만 백본별 차이가 있다. OLMo는 선호 추종 생성에서 26.6%포인트 오르고 PersonaMem과 ToMi도 개선했지만 BigToM Forward Belief와 Forward Action에서 각각 8.2, 7.0%포인트 떨어졌다.
실무 관점에서 이 논문이 주는 것은 파이프라인 패턴이다. 사용자 상태를 직접 관찰할 수 없을 때 시뮬레이터로 상태를 만들어내고, 그 상태를 본 교사(오라클)의 응답을 정답으로 삼아 학생을 학습시키면, 배포 시점에는 상태 없이 관찰 가능한 대화만으로 그 결정을 흉내 낼 수 있다. 개인화 응답과 선호 추종, 사용자 기억이 필요한 챗봇이나 에이전트를 만든다면 참고할 만하다. 다만 확인해야 할 점이 있다. 상태 변수는 실제 사용자의 정신 상태 측정값이 아니라 시뮬레이터가 정의한 제어 변수이고, 벤치마크 내용은 코퍼스 생성에서 제외했지만 PersonaMem류 QA는 네 선택지 형식을 공유하며, 개선폭은 백본과 데이터 비율에 따라 다르게 나타난다. 저자들도 정신 상태 추론 이득이 모델마다 달라 OLMo에서는 손실이 나타났다고 밝힌다. 향후 과제로는 실제 사용자의 의도를 능동적으로 이끌어내는 방법, 일상 대화에서 유용한 지도를 식별하는 방법, 프라이버시 보호와 학습 데이터 사용에 대한 사용자 통제 보장, 믿음과 목표, 상황이 어떻게 변하는지 더 충실히 시뮬레이션하는 것을 제시하며, 실제 경험과 시뮬레이션 경험을 결합하는 것이 장기적 AI 협력자로 가는 길이라고 본다.