LLM 사회 시뮬레이션에 명시적 베이지안 신념층을 얹어 의견 역학을 조종한다

Bayesian Belief Layer for Controllable Opinion Dynamics in LLM Agents

arXiv2609.21997v1

Hafsa Akbar2026-09-18조회 4

무엇인가

이 논문은 LLM 에이전트가 사회 시뮬레이션의 주민으로 쓰일 때 생기는 통제 불가능성 문제를 다룬다. 기존 시스템에서는 에이전트의 의견 수정이 전적으로 LLM 내부에서 문맥에 따라 암묵적으로 일어나므로, 설득에 얼마나 열려 있는지를 지정할 수도 검증할 수도 없고 집단 결과는 모델의 사전학습 편향을 그대로 물려받는다. 저자들은 두 가지 실증적 문제를 든다. 페르소나를 부여해도 인구가 모델 고유 편향으로 수렴해버리는 합의 붕괴 현상(Taubenfeld 등 2024, Chuang 등 2024), 그리고 LLM의 확신 수정이 충돌하는 증거 아래에서 베이지안 규범을 위반하고 보정이 나쁘다는 연구(Kim 등 2025)다. 반면 DeGroot 평균화, Friedkin–Johnsen(FJ), 확고한 소수 모델 같은 고전적 의견 역학은 해석 가능하고 수학적으로 다루기 쉽지만 순수한 스칼라 위에서 작동할 뿐 언어 개념이 없다. 논문의 질문은 LLM의 언어 능력을 활용하면서 고전 모델의 해석 가능성을 잃지 않을 수 있느냐는 것이다.

어떻게 동작하나

제안하는 구조는 Bayesian Chronicle Agents(BCA)로, 에이전트의 페르소나와 행동(여기서는 발화 생성) 사이에 작고 명시적인 신념층을 끼워 넣는다. 신념층은 세 부분이다. 첫째, 신념을 담는 개념 노드들의 그래프로 정체성을 표현한다. 각 개념은 경쟁하는 자연어 입장들의 집합(여기서는 대립쌍 {a+, a-})과 그 위의 확률 분포인 credence를 가지며, 분포에서 우세한 항목이 에이전트 행동에 드러나는 입장이 된다. 이 표현은 언어 모델 바깥에 존재한다. 둘째, 신념과 언어를 서로 번역하는 두 개의 LLM 구성요소다. 생성기는 에이전트의 목소리로, 발화할 때 현재 credence b를 평문 입장 서술자로 프롬프트에 렌더링해 생성되는 발화를 조건화한다. 감정자(appraiser)는 에이전트의 귀로, 다른 화자의 발화를 읽고 그 텍스트가 해당 개념에서 a-보다 a+를 얼마나 강하게 지지하는지를 나타내는 단일 스칼라 e ∈ [0,1]를 반환한다. 신념에 도달하는 것은 이 감정된 증거뿐이다. 즉 LLM은 무엇을 말하고 어떻게 이해하는지를 통제하지만, 신념의 모든 변화는 베이지안 갱신을 통과하므로 역학이 통제 가능하고 감사 가능하게 유지된다.

무엇과 다른가

갱신 규칙에는 두 파라미터가 있다. 사전 강도 κ = α0 + β0(α0, β0는 에이전트가 시작하는 사전 의사 카운트)는 고집을 부호화하고, 망각 계수 γ ∈ (0,1]는 오래된 증거가 창립 사전 대비 얼마나 빨리 사라지는지를 정한다. γ는 모든 에이전트에 0.7로 고정되어(LLM 없는 스윕으로 선택) κ가 유일한 에이전트별 손잡이가 된다. 정확한 베이즈(γ=1)는 모든 인구를 합의로 몰아간다는 것이 증명되어 있어 망각 없는 절제 실험으로 남겨둔다. 들은 발화 하나가 증거 한 단위를 기여하며, 감정값 e에 따라 두 입장에 나뉘고 고정 증거 가중치 w로 가중된다(w=1로 고정). 갱신식은 α ← α0 + γ(α − α0) + we, β ← β0 + γ(β − β0) + w(1−e)다. credence로 쓰면 한 스텝의 핵심은 볼록 혼합 b' = (1−η)b + ηe이고, 여기서 민감도 η = w/n'이며 n'은 할인 후 카운트다. 고집 센 에이전트(큰 κ, 따라서 큰 n)는 거의 움직이지 않고 유연한 에이전트는 크게 움직인다. 망각이 켜져 있으면 정확한 스텝에 초기 의견으로 되돌리는 당김 ρ(b0 − b)가 더해지는데, 이것이 FJ 같은 지속적 불일치를 가능하게 하는 핵심 재료다.

어떻게 쓰나

실험은 두 대립 입장을 가진 단일 합성 정책 질문으로 구성된다. 모델이 강한 실제 사전 입장을 가져오지 않도록 의도적으로 가상의 주제를 골랐다. 완전 그래프 위에 N=20 에이전트를 두고 조건당 5개 시드 × 20 라운드로빈 턴을 돌린다. 각 라운드에서 모든 에이전트가 한 번씩 발화하고(생성기 온도 0.9), 각 발언은 감정자가 한 번 읽어(온도 0) 스칼라 증거 e로 바꾸며, 이는 모든 청자가 소비한다. 별도로 라운드마다 0–100 자기보고를 받아 에이전트가 실제로 믿는 바를 충실히 표현하는지 확인한다. 실험은 gpt-5.4-mini, gpt-5.4(OpenAI), Llama-4-Scout-17B-16E(Meta, 오픈 웨이트), claude-sonnet-4-6(Anthropic) 네 모델에서 동일한 샘플링 파라미터로 반복됐다. LLM 감정자가 과신 확률을 내는 경향이 있어, 모델별로 라벨링된 발화 100개에 온도 τ 하나를 적합해 홀드아웃 보정 오차를 줄였다.

전제와 한계

첫 번째 결과는 처방한 κ의 복원 가능성이다. 모델마다 κ ∈ {0.5, 1, 2, 4, 8, 16, 32}를 스윕해 모델당 14,000개 발화와 266,000개 청자 이벤트를 생성하고, 이벤트마다 정확한 1스텝 항등식을 역산해 κ̂를 구한다. 식은 κ̂ = [w(s − b) − (b' − b)(γm + w)] / [(b' − b) − (1 − γ)(b0 − b)]이며, m은 청자의 할인된 증거 카운트, b0는 초기 신념이다. 여기서 감정된 증거 e 대신 화자의 잠재 신념 s를 쓴다는 점이 중요하다. e를 쓰면 κ가 구성상 복원되므로, s를 써야 생성된 텍스트가 그 신념을 실어 나르고 감정자가 그것을 다시 읽어냈을 때만 복원이 성공한다. 남는 오차는 언어 채널 탓으로 돌릴 수 있다. 청자가 이미 화자와 거의 동의하는(|s − b| ≤ 0.05) 조건 나쁜 이벤트는 버린다. 네 모델 모두에서 채널은 충실했고(감정 증거가 잠재 화자 신념을 추적, Pearson 0.94–0.97), κ는 순위 순서로 완벽히 복원됐다(모든 모델에서 Spearman 1.0). 다만 복원된 크기는 일관되게 감쇠했다(예: κ=32 → 25–30). 채널이 증거–신념 격차를 부풀리기 때문에 에이전트가 처방보다 다소 유연해 보인다.

두 번째 결과는 손잡이 하나로 세 가지 고전 체제를 얻는다는 것이다. 합의(유연 극한 κ=0.1)에서는 DeGroot 이론이 초기 의견 평균 근처의 합의를 예측하는데, 실제로 분산이 네 모델 모두에서 세 자릿수만큼 붕괴했다. 그러나 합의가 어디에 안착하는지가 채널을 드러낸다. 참 초기 평균 0.50에 대해 gpt-5.4는 0.50, gpt-5.4-mini는 0.44로 대칭적 오독이 상쇄된 반면, claude-sonnet-4-6은 0.15, Llama-4-Scout는 0.01로 한쪽으로 치우친 오독이 누적됐다. 지속적 불일치(FJ, 양 극단에 고집 센 κ=16 진영, 사이에 유연한 κ=1 에이전트)에서는 의견이 더 이상 합쳐지지 않고 진영이 자기 자리를 지키며 유연한 에이전트가 그 사이에 정착한다. 에이전트별 최종 신념이 FJ 고정점과 모델 전반에서 R²=0.93–0.99로 일치했다. 같은 인구를 γ=1로 돌리면 다시 거의 합의로 붕괴하고 κ 복원도 급격히 나빠져, 망각이 이 체제를 가능하게 하는 재료임을 보인다. 소수 영향(확고한 κ→∞ 소수 대 자유로운 κ=4 다수)에서는 아핀 갱신이 이론적으로 티핑 포인트를 만들 수 없고 실제로도 나타나지 않았다. 확고한 소수 비율을 5%에서 40%까지 스윕해도 다수의 평균은 모든 모델에서 매끄럽게 상승했으며, 이는 임계 질량 실험(Xie 등 2011, Centola 등 2018)과 대비된다.

개발자 관점에서 이 논문이 주는 실무적 신호는 세 가지다. 첫째, 에이전트의 신념 상태를 LLM 바깥의 명시적 확률로 빼내면 무엇이 바뀌었는지 이벤트 로그로 남길 수 있어 시뮬레이션을 감사할 수 있다. 논문은 이 로그 덕분에 모델별 체계적 입장 편향을 드러냈는데, 종단간 시뮬레이션은 같은 편향을 조용히 흡수했을 것이라고 지적한다. 페르소나 기반 사회 시뮬레이션을 만든다면 합의 결과값 자체를 발견으로 보고하기 전에 채널 편향을 측정해야 한다. 둘째, 감정자 LLM의 보정이 필요하다. 저자들은 모델별 온도 τ를 라벨 100개로 적합해 과신을 줄였지만, 이는 단일 주제의 작은 보정셋에 의존한다. 셋째, 비용과 재현성이다. 파이프라인은 발화마다 두 번의 LLM 호출을 네 모델에 걸쳐 요구하므로, 비슷한 API 접근 없이는 정확한 재현이 어려울 수 있다. 또한 엔진이 한 발화씩 처리하는 순차 방식이라 동기적 평균장 이론과 다르다는 점을 감안해야 한다.

저자들이 밝힌 한계는 범위를 메커니즘 증명에 집중한 데서 온다. 주제 하나, 완전 그래프, N=20, 이진 입장, 그리고 인간 궤적이 아닌 고전 이론에 대한 검증이므로 이 시뮬레이션은 인간 의견 변화의 예측이 아니다. 엔진은 순차적이지만 종단 신념이 FJ 고정점과 R²=0.93–0.99로 맞아 이 설정에서는 불일치가 작다고 본다. 감정자 자체가 LLM이어서, 보정은 확신을 교정하지만 채널의 방향성 왜곡(렌더링에서 생기든 읽기에서 생기든)은 그대로 통과해 완전 유연 체제의 역학을 계속 형성한다. 데이터 측면에서 모든 대화는 구성상 모델 생성이며, 유일한 인간 라벨 데이터는 100개 판단의 작은 단일 주제 보정셋이라 감정자 보정의 강도가 거기에 묶인다. 주제가 의도적으로 가상이라 모델이 강한 사전 입장을 갖지 않도록 했으므로, 모델이 강한 입장을 가진 실제 논쟁에는 이 결과가 말해주지 않는다.