언어 에이전트의 사회적 목표 달성과 통신 비용을 함께 훈련하는 TACT

Towards Communication-Efficient Social Intelligence in Language Agents

arXiv2609.35749v1

Linxiao Gong2026-09-28조회 2

무엇인가

이 논문은 언어 에이전트가 협상하고 조율하며 상충하는 선호를 해소할 때, 목표 달성만이 아니라 그 목표에 도달하는 데 든 의사소통 비용까지 함께 다룬다. 저자들은 의사소통 효율을 행동 전략(action strategy)과 표현(expression) 두 축으로 규정하고, 낭비가 생기는 경로를 두 가지로 지목한다. 하나는 하나의 발화 안에 들어간 불필요한 군더더기이고, 다른 하나는 상대의 제약 조건을 해결하지 못한 행동 때문에 뒤따르는 추가 교환이다. 응답 하나의 길이만 봐서는 이 비용을 알 수 없다는 것이 이들의 문제 설정이다. 대화가 진행되며 공통 기반이 쌓이면 초반에 필요했던 상세한 설명이 나중엔 짧아질 수 있지만, 짧은 표현이 상대에게 필요한 정보를 빼먹을 수도 있고, 상대가 명시한 제약을 무시한 행동은 길이를 줄여도 고쳐지지 않는다.

어떻게 동작하나

제안 방법 TACT(Teacher-Assisted Communication Training)는 학생이 실제로 생성한 행동에서 출발한다. 같은 가시적 문맥 아래에서 두 전문가가 각각 하나씩 대안을 만든다. 표현 전문가는 원래 행동의 의도·사실·약속·행동 유형을 보존하면서 더 간결한 문장을 제안하고, 전략 전문가는 의도와 행동 유형 자체를 바꿀 수 있다. 예를 들어 상대가 밝힌 제약을 수용하거나, 다른 안을 제시하거나, 확인을 요청하거나, 대화를 끝내는 쪽으로 수정한다. 두 전문가는 서로 다른 지시문을 받지만 동결된 모델 파라미터를 공유할 수 있다. 훈련 데이터는 두 역할을 같은 학생 스냅샷으로 굴린 온폴리시 롤아웃으로 모으고, 학습 슬롯 A만 손실에 기여하며 B는 상대 역할을 맡는다.

무엇과 다른가

수정안은 겉모습만으로 채택되지 않는다. 원래 행동을 0번 분기, 두 전문가 대안을 1·2번 분기로 두고, 같은 공개 이력에서 각 분기가 합법적인 상대 응답을 딱 하나씩 받은 뒤 멈춘다. 그다음 목표 텍스트 g를 고정된 채점 템플릿에 넣고 토큰별 로그확률 평균을 계산해, 행동 전후의 정보 이득을 구한다. 채점자는 배치 안에서 동결된 학생 스냅샷이며 별도의 품질 평가 모델을 두지 않는다. 표현 후보는 원래보다 토큰이 적고 정보 이득이 양수일 때, 전략 후보는 정보 이득이 원래 행동보다 클 때 자격을 얻는다. 자격을 얻은 후보들 중에서 정보 이득은 크고 토큰 비용은 작은 비지배 집합을 만든 뒤, 그 안에서 정보 이득을 토큰 비용으로 나눈 값이 최대인 후보를 참조로 고른다. 자격 후보가 없으면 그 행동에서는 업데이트하지 않는다.

어떻게 쓰나

선택된 참조는 학생에게 직접 주어지지 않는다. 온폴리시 증류에서 참조는 교사에게만 추가 문맥으로 주어지고, 교사는 학생이 실제로 생성한 원래 토큰 접두사에 대해 토큰 수준 피드백을 준다. 학생은 자신의 원래 입력 문맥을 유지하며, 배포 시점에는 전문가도 교사도 필요 없이 혼자 행동한다. 배치 업데이트 후에는 갱신된 학생이 새 상호작용을 수집하고, 전문가와 채점 교사는 동결된 채로 남는다.

전제와 한계

실험은 SOTOPIA와 AgentSense에서 이뤄졌다. SOTOPIA는 90개 시나리오에 5개 캐릭터 조합을 붙인 450개 설정이고 여기에 공식 14개 시나리오 SOTOPIA-Hard 부분집합 70개 설정이 포함된다. AgentSense는 100개 2인 템플릿에서 뽑은 500개 인스턴스다. 학생은 Qwen3.5-4B, 전문가와 교사는 동결된 Qwen3.5-27B이며 LoRA로 대상 에이전트만 학습한다. 판정은 DeepSeek-v4-pro가 SOTOPIA 루브릭으로 수행하고 이 점수는 훈련 보상으로 쓰이지 않는다. 결과적으로 TACT는 SOTOPIA-All과 SOTOPIA-Hard 모두에서 평가된 방법들 중 가장 높은 Goal을 기록했고, SFT+SDPO보다 훨씬 적은 대상 토큰을 사용했다. 초기 학생보다 높은 Goal을 더 적은 토큰으로 달성했으며, 바닐라 OPD와 비교하면 All에서 비슷한 토큰 비용으로 더 높은 Goal을 더 많은 턴에 걸쳐 얻었다. 간결 프롬프트 베이스라인은 토큰 비용이 가장 낮았지만 Goal도 낮았다.

세부 비교도 제시된다. 프롬프트를 추가한 Prompted OPD는 바닐라 OPD보다 All Goal을 4.960에서 5.151로 올렸지만 Hard Goal은 보고된 정밀도에서 3.686으로 그대로였다. 전문가 구성 비교에서는 표현 전용 모델이 대상 토큰을 더 적게 쓰고 전략 전용 모델이 턴 수를 더 적게 쓰는 뚜렷한 대비가 All과 Hard 모두에서 나타났으며, 둘을 합친 전체 프레임워크가 어느 단일 전문가보다 높은 Goal을 얻었다. 선택 방식 비교에서는 TACT가 정보 이득만 쓰거나 토큰만 최소화하거나 무작위로 고르는 변형보다 두 패널 모두에서 높은 Goal을 기록했다. AgentSense에서는 추가 학습 없이 초기 학생보다 높은 목표 성공률과 관계 점수를 더 적은 토큰·메시지로 달성했고, 바닐라 OPD와는 목표 성공률이 54.2% 대 54.6%로 비슷하면서 대상 토큰 6.2%, 메시지 6.0%를 줄였다. 상대 모델을 Llama-3.1-8B-Instruct로 바꾸거나 같은 정책끼리 자기대국을 시켜도 TACT가 네 방법 중 최고 Goal을 유지했지만, 토큰 절감은 상대에 따라 달라 All에서 Llama 상대일 때 330.2 대 361.4, 자기대국에서는 313.5 대 253.0으로 오히려 늘어났다. DeepSeek-v4-pro, Kimi K2.6, GLM-5.2 세 판정자 모두 Goal 기준으로 TACT를 1위로 꼽았으나, Hard Avg에서는 Kimi가 바닐라 OPD를 근소하게 앞세웠다(1.255 대 1.249).

개발자에게 이 논문이 주는 실무적 시사점은 분명하다. 협상, 일정 조율, 고객 응대처럼 여러 턴을 주고받으며 목표를 밀어붙여야 하는 에이전트에서 목표 달성률과 토큰·턴 비용을 동시에 관리하려 할 때 참고할 만하다. 핵심 착안은 교사가 만든 좋은 답을 그대로 모방 학습시키는 대신, 학생이 실제로 지나간 접두사 위에서 참조를 조건으로 토큰 수준 피드백을 주는 것이다. 배포 시에는 전문가와 교사가 필요 없어 추론 비용이 늘지 않는다는 점도 실무적으로 중요하다. 다만 목표 지원이 목표 문장의 로그확률이라는 프록시로 측정되고, 분기마다 상대 응답을 하나만 샘플링하며, 최종 평가가 LLM 판정자에 의존한다는 점을 감안해 자체 도메인에서 재검증해야 한다.

저자들이 밝힌 한계도 분명하다. 선택 규칙은 프록시 기반이며 최종 사회적 품질에 대한 비열등성 검정이 아니라고 명시한다. 단일 응답 분기는 전체 대화 결과의 인과적 귀속이 아니라 기여 프록시이고, 선택된 후보가 사회적으로 충분하다는 라벨도 아니며, 협력적 응답 뒤에 간결한 약속이 목표 지원을 올리면서도 합의를 모호하게 남기는 실패를 놓칠 수 있다고 밝힌다. 표현 후보의 의미 보존은 프롬프트 지시로만 요구되고 검증된 의미 일관성 필터가 없다. 윤리 성명에서는 효율적 목표 추구를 사회적으로 적절한 행동으로 오인하면 안 되며, 사적 목표 프록시가 강압이나 누락된 경계, 불신뢰 약속을 놓칠 수 있고, 시뮬레이션 결과는 사람 상대 배포에 아무 보증도 주지 않는다고 못 박는다. 코드는 논문 채택 시 공개 예정이라고만 밝히고 있으며 원문에 저장소 URL은 제시되지 않았다.