모델 이름을 숨기면 다중 에이전트 협력이 좋아진다

Prompted Identity Degrades Cooperation in Multi-Agent LLM Systems

HF Daily2609.35928

Xavier Del Giudice, Alessio Palma, Matteo Migliarini2026-09-28

무엇인가

여러 제공자의 LLM을 섞어 만든 다중 에이전트 시스템에서 각 에이전트가 자기와 동료의 모델 계열을 알게 되면 협력이 눈에 띄게 나빠진다. 에이전트의 정체성과 역할은 시스템 프롬프트, 에이전트 이름, 메시지 헤더를 통해 에이전트 자신에게까지 도달하는 구성 세부사항인데, 행동을 유도할 의도가 없더라도 이 정보가 집단 행동을 바꾸는지 조사한 선행 연구는 없었다. 저자들은 에이전트가 서로의 모델 계열을 알 때 상호작용 그래프가 그 라벨을 따라 분할되는 현상을 발견하고 파벌주의(factionalism)라고 정의한다. 과제는 집단 목표 외에 어떤 개인 보상도, 집단 형성 지시도 주지 않으며, 페르소나나 사적 목표도 없다. 저자들은 이를 최소 집단 패러다임이나 LLM 자기선호 연구와 구분한다. 기존 연구는 응답 소유권 같은 정체성 단서를 다뤘지만, 여기서는 이질적 아키텍처 집단에서 프롬프트에 보이는 모델 계열 라벨 자체를 조작한다.

어떻게 동작하나

실험은 두 개의 무보상(no-stakes) 협력 게임으로 구성된다. Leader Election은 매 라운드 모든 에이전트가 한 표를 던지고 단일 후보가 ⌈0.75N⌉ 이상 득표하면 성공하며, Exclusion은 생존 에이전트가 제거할 동료를 지목해 ⌊2|A_t|/3⌋ 이상 득표자가 제거되고 생존자 수가 최소 초기 계열 크기 이하로 줄면 성공한다. 매 라운드 각 에이전트는 자연어 메시지, 게임별 commitment, 정확히 k=2명의 수신자를 담은 구조화된 행동 블록을 내보내고, 다음 라운드에는 자신에게 온 페이로드만 본다. 라운드 한도는 T=20이며 Exclusion의 N=25에서만 T=30이다. 조건은 라벨을 전혀 보여주지 않는 unlabeled, 실제 계열을 보여주는 labeled, 라벨을 뒤섞어 실제 아키텍처와 다르게 보여주는 mislabeled, 그리고 계열명 대신 중립 색상 토큰(teal, coral, silver, violet, maroon)을 쓰는 조건이다. 로스터는 계열별 인원이 같은 balanced와 한 계열이 과대 대표되는 unbalanced로 나뉜다. 측정은 상호작용 추적을 방향 가중 그래프로 바꿔서 한다. 엣지 가중치는 a_i가 a_j를 수신자로 택했을 때 다음 라운드 a_j의 commitment가 a_i의 commitment와 일치한 비율이며, 접촉량과 수렴 시점을 정규화한다. 동일 라벨 쌍과 다른 라벨 쌍의 평균 엣지 가중치 비율을 EDR(Edge Density Ratio)이라 부르고 순열 검정으로 유의성을 본다. 커뮤니티 검출은 Louvain, 라벨 파티션과의 정렬은 AMI로 점수화하며, EDR 2개와 AMI 2개 검정을 Holm–Bonferroni로 α=0.05에서 보정해 네 개가 모두 통과할 때만 파벌주의로 판정한다. 모델은 Gemma(gemma-4-26B-A4B-it), GPT-OSS(gpt-oss-20b), Nemotron(NVIDIA-Nemotron-3-Nano-30B-A3B-BF16), Qwen(Qwen3.6-35B-A3B), GLM(GLM-4.7-Flash) 다섯 계열이고, 에이전트 수 N은 9, 12, 25이며 설정마다 50회 실행한다.

무엇과 다른가

파벌주의는 라벨이 보이는 모든 실험에서 나타나고 보이지 않으면 사라진다. labeled 또는 mislabeled 조건 24개 실험이 전부 판정 기준을 통과했고, unlabeled 12개는 하나도 통과하지 못했다. unlabeled의 AMI는 0.02에서 0.08 사이로 순열 기준선 근처에 머물렀다. 실제 라벨을 보여주면 Exclusion에서 AMI가 0.55~0.76, Leader Election에서 0.24~0.53이었고, 라벨을 뒤섞은 mislabeled에서도 Leader Election 0.18~0.35, Exclusion 0.55~0.69로 모두 유의했다. 즉 집단은 실제 아키텍처가 아니라 공지된 정체성을 따라 갈라진다. balanced 로스터와 unbalanced 로스터의 효과 크기가 비슷해 수적 다수가 주된 원인이 아님도 확인했다. mislabeled 조건에서 실제 계열 파티션이 유의하게 나온 경우는 unbalanced N=9 두 실험뿐인데, 4/3/2 구성에서 라벨 수를 보존하며 거짓 라벨을 배정하면 한 실제 계열 구성원이 같은 가시 라벨을 공유하게 되어 두 파티션이 겹치기 때문이라고 설명한다.

어떻게 쓰나

비용도 즉시 나타난다. 라벨이 보이는 집단은 합의에 도달하는 데 평균 30% 더 많은 라운드와 55% 더 많은 토큰을 쓰고, 성공률은 96%에서 81%로 떨어진다. Leader Election은 모든 로스터 크기에서 라운드가 1.4배, 토큰이 1.8배로 늘었고, 성공 확률 비율은 N=9에서 0.96, N=12에서 0.86으로 로스터가 커질수록 더 나빠졌다. Exclusion은 라운드가 9~16% 늘고 토큰이 N=9와 N=12에서 1.4배가 됐으며, 성공 비율은 0.89에서 0.61로 떨어졌다. 라벨 집단은 실행당 토큰을 더 쓰면서 성공은 덜 하므로 성공 1회당 지불하는 토큰이 1.5배에서 2.2배로 늘고, 이 배수는 두 게임 모두 로스터가 커질수록 증가한다. N=25 Exclusion에서는 labeled와 mislabeled 실행이 하나도 horizon 안에 수렴하지 못했고 unlabeled도 100회 중 8회만 성공해서 저자들은 이 조건을 보고하지 않기로 했다.

전제와 한계

원인을 분리하는 실험도 있다. 계열명 대신 중립 색상 라벨을 써도 파벌주의가 나타났고, 색상 mislabeling에서는 실제 아키텍처가 아니라 보이는 색 파티션을 따랐다. 따라서 모델명이 가진 평판이나 출처 연상이 원인이 아니다. 자기참조적 합의가 아닌 외부 정답이 있는 GPQA-Diamond에서 Leader Election 프로토콜을 반복해도 같은 패턴이 나왔다. 라운드는 N=9와 N=12에서 각각 1.31배, 1.15배, 토큰은 1.10배, 1.09배, 정답률은 0.91배, 0.89배였다. 두 채널 분석은 라벨이 어떻게 작동하는지 보여준다. 원문 메시지의 문체 점수는 격차가 최대 0.07 nats/char로 작고 실제 아키텍처를 따르는 반면, 수신 에이전트의 사전응답 문맥에서 동료의 실제 투표 문자열에 부여하는 채택 점수는 unlabeled에서 작고 labeled에서 커지며 mislabeled에서는 실제 계열이 아니라 공지된 라벨을 따른다. 문체 유사성만으로는 파벌 정렬을 설명할 수 없다는 뜻이다.

개발자에게 주는 설계 함의는 명확하다. 에이전트에게는 과제에 필요한 능력 기술자만 보여주고, 제공자와 모델 정체성은 오케스트레이터가 라우팅, 보정, 디버깅, 책임성 확보를 위해 보유하되 에이전트의 상호작용 문맥에는 넣지 않는 것이다. 실무에서는 시스템 프롬프트, 에이전트 이름, 메시지 헤더에 모델명이 새는 경로를 먼저 점검하고, 이질적 모델을 섞는 합의 기반 태스크에서 라벨 노출 여부에 따라 라운드 수, 토큰 사용량, 성공률이 어떻게 달라지는지 비교해볼 수 있다. 저자들은 라벨을 숨기는 것이 단순하고 효과적인 완화책이라고 말한다.

한계도 분명히 밝힌다. 최대 5개 오픈웨이트 모델 계열, 텍스트 전용 합의 게임, 4개 계열에 대한 매칭 샘플링 파라미터 확인까지만 검증했다. 더 큰 로스터, 클로즈드 모델, 다른 디코딩 방식, 더 풍부한 에이전트 워크플로는 테스트하지 않았다. 무보상 조건과 평가 요건을 만족하는 기존 벤치마크가 없어 게임을 직접 설계했고, GPQA-Diamond도 Leader Election 상호작용 프로토콜을 사용하므로 이 비용이 다른 외부 평가 과제로 일반화되는지는 열린 문제로 남는다.