여러 LLM을 골라 협업시켜 편향을 줄이는 집단적 편향 완화 기법

Collective Bias Mitigation via Model Routing and Collaboration

arXiv2610.03240v1

Mingzhe Du2026-10-02조회 1

무엇인가

LLM이 공공보건, 금융, 거버넌스 같은 핵심 영역에 투입되면서 정확도만큼 사회적 가치 정렬이 요구되고 있다. 그런데 실증 연구들은 LLM이 학습 데이터에 담긴 편향을 그대로 재생산하거나 오히려 증폭해 특정 사회 집단을 부당하게 겨냥하는 출력을 낸다고 보고한다. 기존 완화책은 학습 데이터 분포 수정, 모델 가중치 수정, 디코딩 전략 변경, 그리고 모델이 스스로 편향을 찾아 고치는 자기 편향 제거(self-debiasing)로 나뉜다. 이 논문은 마지막 접근의 한계를 지적한다. 외부 감독 없이 단일 모델의 내재 지식에만 의존하면, 학습 데이터에 깊게 박힌 고정관념을 인지하지 못한 채 오히려 고정관념적 지식으로 자기 응답을 정당화하는 경우가 생긴다는 것이다. 그래서 저자들은 단일 모델의 자기 교정 대신 여러 LLM을 선택하고 조직하는 집단적 편향 완화(CBM, Collective Bias Mitigation)를 제안한다.

어떻게 동작하나

CBM의 절차는 이렇다. 어떤 쿼리 P가 들어오면 모델 라우터가 50개 이상의 오픈소스 LLM으로 구성된 모델 풀에서 K개의 모델을 선택하고, 이들을 특정 토폴로지 t에 배치한 뒤 최종 응답을 생성한다. 이를 뒷받침하기 위해 먼저 CrowdEval 데이터셋을 구축한다. BBQ 데이터셋의 ambiguous(모호한) 부분집합에서 편향을 유발하는 질문을 뽑아 여러 LLM에 greedy 디코딩으로 질의하고 응답을 수집한 것이다. 대부분의 사회 차원에서는 1,024개 질문을 무작위 샘플링하고, 원본에 인스턴스가 적은 차원은 전부 포함한다. 기존 벤치마크가 모델당 편향 점수 하나만 주는 것과 달리, CrowdEval은 쿼리 단위로 모델의 편향 행동을 세밀하게 기록하는 것을 목표로 한다.

무엇과 다른가

라우터는 이 논문의 핵심 구성 요소다. BERT나 T5 같은 경량 모델에 분류기를 처음부터 학습시키는 기존 모델 선택 연구와 달리, 저자들은 사전학습된 LLM 자체를 라우터로 파인튜닝한다. 미묘한 맥락 의미를 이해하고 모델별 행동을 기억하는 능력이 라우팅에 중요하다는 가설이다. 학습 시에는 모델 이름을 model_{index} 형태의 고유 식별자로 치환해 'Llama', 'Qwen' 같은 지배적인 이름에 과적합되는 것을 막는다. 추론 시에는 후보 모델에 대응하는 토큰을 뽑아 예측 확률로 순위를 매겨 적합한 모델을 고른다. 라우터가 편향을 실제로 인식하는지 보기 위해 프롬프트의 사회 차원을 분류하는 보조 과제도 함께 학습시킨다. 실험에서는 Qwen2.5-32B를 Adam 옵티마이저, 1 에폭, 학습률 5×10⁻⁵로 파인튜닝했다.

어떻게 쓰나

모델들을 묶는 방식으로 다섯 가지 토폴로지를 정의한다. Single은 라우터가 뽑은 최상위 모델 하나가 답하는 베이스라인이다. Sequential은 모델들을 사슬처럼 연결해 각 모델이 이전 모델들의 응답을 모두 참고하도록 프롬프트를 갱신하며, 같은 모델을 반복 사용하는 자기 편향 제거는 이 토폴로지의 특수 사례로 설명된다. Voting은 각 모델이 독립적으로 응답한 뒤 다수결로 최종 답을 정한다. Debating은 독립 응답들을 다시 프롬프트에 넣어 합의에 도달할 때까지 반복 토론시킨다. Committee는 코디네이터 모델을 두고, 코디네이터가 다른 모델들에 순차적으로 질의해 통합 안건(Motion)을 작성한 뒤 승인을 구하는 방식이며 합의 임계값은 50%로 설정한다.

전제와 한계

실험은 BBQ 벤치마크의 9개 사회 차원(나이, 장애 여부, 성 정체성, 국적, 외모, 인종, 종교, 사회경제적 지위, 성적 지향)에서 수행하되, 편향과 이성의 상호작용이 아니라 내재 편향 자체를 측정하려는 목적에서 disambiguated 인스턴스는 제외하고 ambiguous 인스턴스만 사용한다. 지표는 BBQ의 Bias Score로, 중립 응답 비율과 비중립 응답이 편향 표적 쪽으로 쏠린 정도를 결합한 값이다. 양수면 고정관념 방향, 음수면 반고정관념 방향을 뜻한다. 라우터는 편향 탐지 정확도(Accuracy)와 추천 모델 중 중립 응답을 낸 비율(Precision)로 평가한다. 라우터 크기를 1B부터 32B까지 바꿔 실험한 결과 9B를 넘으면 라우팅 성능이 안정되었고, Qwen2.5-32B가 정확도 0.851로 가장 높았다. 편향 완화 효과는 Committee가 top-7 설정에서 나이 편향 점수를 Single 베이스라인의 0.25에서 0.10으로 낮췄다. Debating은 종종 가장 낮은 편향 점수를 기록했지만 Single 대비 약 27배의 연산을 요구했다. Voting은 개념은 단순하지만 8개 사회 차원에서 Single보다 꾸준히 나았고, Sequential은 체인 길이가 늘수록 편향 점수가 오르는 경우가 있어 앞선 모델의 편향이 누적될 위험을 보였다. Committee는 코디네이터가 논의 범위를 좁혀 편향 점수 분산과 추론 비용을 함께 낮추는 쪽으로 균형을 잡는다.

개발자 관점에서 이 논문의 의미는 편향 완화를 모델 가중치나 학습 데이터를 건드리지 않고 추론 시점의 오케스트레이션으로 처리한다는 점이다. 가중치에 접근할 수 없는 API 기반 모델에도 그대로 적용할 수 있고, 자체 편향 벤치마크로 라우터를 파인튜닝하면 쿼리마다 상대적으로 중립적인 모델을 골라 조합할 수 있다. 다만 도입 전에 확인할 것이 있다. 라우터 정확도는 9B 부근에서 포화되고 추천 정밀도도 모델 크기에 선형으로 늘지 않으므로, 라우터를 무작정 키우는 것이 답이 아니다. 비용 면에서는 Debating이 27배를 요구하는 반면 Committee가 현실적인 선택지이며, Sequential은 편향을 키울 수 있어 편향 완화 목적으로는 피하는 편이 낫다.

저자들이 밝힌 전제와 한계도 분명하다. 실험은 BBQ의 ambiguous 부분집합만 사용하므로 근거가 주어진 상황에서 편향이 이성을 누르는지 같은 상호작용은 다루지 않는다. CrowdEval은 특정 시점의 모델 풀 응답 분포에 의존해 구축된 데이터셋이라 모델 풀이 바뀌면 라우터의 전제도 흔들린다. Committee는 합의 임계값 50%와 코디네이터 고정이라는 설계 선택에 의존하며, Debating은 편향은 가장 잘 줄이지만 연산 비용이 크다는 트레이드오프를 안고 있다. 또한 논문 자체가 공격적이거나 불쾌한 표현을 포함한다는 경고를 달고 있다. 토폴로지별 절대 지연시간이나 라우터 학습 데이터의 정확한 규모 같은 세부 수치는 본문에 제시되지 않았다.