MARGIN이 이종 모델 확신 점수를 실행 중에 모델별로 보정한다

MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination

HF Daily2605.22949

Joss Armstrong2026-10-08

무엇인가

여러 파운데이션 모델에 같은 문제를 던지고 답을 모아 하나를 고르는 코디네이터는 각 모델이 스스로 보고한 확신도(confidence)를 가중치로 쓴다. 그런데 같은 0.9라는 숫자가 모델마다 다른 의미를 갖고, 작업 분포가 바뀌면 그 의미도 바뀐다. 이 논문은 이를 개별 모델의 진단 문제가 아니라 조정(coordination) 문제로 규정한다. BigCodeBench에서 18개 모델 풀의 평균 확신도와 실제 통과율은 음의 상관(r=-0.692, 95% 구간 [-0.759,-0.514])을 보였고, 같은 문제에 정답 하나와 오답 하나가 있을 때 더 확신하는 쪽을 고르는 비율은 42.37%([38.99,45.58])로 우연보다 낮았다. 확신도가 높은 응답자를 신뢰하는 기본 전략이 특정 워크로드에서 역방향으로 작동한다는 진단이다.

어떻게 동작하나

MARGIN(Multi-Agent Runtime Grading via Incremental Normalisation)은 모델을 재학습하지 않고, 별도 캘리브레이션 데이터셋도 쓰지 않으며, 모델 내부(logits나 가중치)에도 접근하지 않는다. 코디네이터가 관찰하는 것은 후보 답, 보고된 확신도, 나중에 도착하는 정오답 라벨뿐이다. [0,1] 확신 구간을 K=3개의 동일 폭 밴드([0,1/3), [1/3,2/3), [2/3,1])로 나누고, (모델, 밴드) 쌍마다 두 개의 지수이동평균을 유지한다. 하나는 그 밴드에서의 실제 정확도 â, 다른 하나는 그 밴드에서 보고된 평균 확신도 c̄다. 둘 다 밴드 중앙값으로 초기화하므로 관측이 없을 때 보정 계수 γ=â/c̄=1이 되어 원래 확신도가 그대로 통과한다. 갱신은 학습률 α=0.04의 EWMA로, 밴드당 유효 기억은 약 1/α개 관측이다.

무엇과 다른가

보정 계수는 정확도와 평균 확신도의 비율 γ=â/c̄다. 예를 들어 정확도 0.60, 평균 확신도 0.90이면 계수 0.67이 되어 0.90이 0.60 근처로 깎인다. 관측이 적은 (모델, 밴드) 쌍은 분산이 크므로 같은 모델의 다른 밴드에서 얻은 모델 수준 추정 γ_i,·(밴드별 EWMA 총합의 관측 수 가중 비율) 쪽으로 축소 혼합한다. γ_eff = n/(n+k_s)·γ_band + k_s/(n+k_s)·γ_model이고 k_s=100이다. 다른 모델의 이력을 빌려오지는 않는다. 보정된 확신도 c̃ = clip(γ_eff·c, 0, 1)는 답 단위 투표의 가중치가 된다. s(y)=Σ c̃_i·1[ŷ_i=y]를 최대화하는 답을 고르며, 코드 생성에서는 줄바꿈 정규화 등을 거친 정확 코드 서명으로 답을 묶는다. 논문은 성공과 실패에 다른 학습률을 쓰는 비대칭 EWMA가 정상성 아래에서도 편향을 만든다는 것을 정리 1로 보인다. 정상 상태 기대값은 α_up·θ/(α_up·θ+α_down·(1-θ))이고 α_up=α_down일 때만 θ와 일치한다. 그래서 MARGIN은 정답과 오답에 같은 학습률을 쓴다.

어떻게 쓰나

실험은 두 갈래다. 하나는 워크로드가 바뀐 뒤 기존 보정이 얼마나 잘 적응하는지(분포 이동), 다른 하나는 이력 없이 시작해 답 선택이 실제로 좋아지는지(콜드 스타트)다. 이동 실험은 18개 모델 풀 중 9개 클라우드 모델 부분집합을 쓰고, 모든 온라인 방법이 같은 소스 관측과 결과를 받고 자기 상태를 유지한 채 타깃으로 넘어간다. 코드 생성은 HumanEval·MBPP에서 BigCodeBench 하드 부분집합(148개 중 4개 격리 후 144개)으로, QA는 MMLU STEM에서 MMLU-Pro 비즈니스로, 수학은 GSM8K에서 MATH로 이동한다. 비교 대상은 슬라이딩 윈도 히스토그램(W=200, 10빈), 감쇠 히스토그램(감쇠 0.98), 윈도 정확도 대체 모드와 곱셈 모드, 온라인 Platt 스케일링(학습률 0.1, L2 계수 1e-4) 다섯 가지다. 결과는 BigCodeBench로의 두 전이에서 MARGIN의 이동 후 ECE가 12.99(HumanEval 출발)와 11.89(MBPP 출발)로 다섯 베이스라인 모두보다 낮았다. 가장 낮은 대안인 온라인 Platt가 각각 15.32, 13.42로 2.33, 1.53 퍼센트포인트 차이다. MMLU에서 MMLU-Pro로의 전이에서는 MARGIN 2.85 대 히스토그램·윈도 정확도 계열 6.87~7.37로 네 비교 모두 MARGIN 우세였고, 온라인 Platt(3.17)과의 비교는 결론이 나지 않았다. 수학 전이에서는 온라인 Platt 상대 비교만 MARGIN 쪽이고 나머지 넷은 불확정이었으며, 같은 과제 테스트 강화(HumanEval+, MBPP+) 조건에서는 다섯 비교 모두 불확정이었다.

전제와 한계

콜드 스타트 조정 실험은 18개 모델 풀이 같은 문제를 답할 때 보정이 선택을 개선하는지 본다. 세 벤치마크 모두 ECE가 낮아졌고, 쌍별 판별력은 HumanEval +35.13, MBPP +31.31, BigCodeBench +20.99 퍼센트포인트 올랐다. 답 선택 정확도는 MBPP에서 87.94%에서 92.26%로, BigCodeBench에서 13.89%에서 27.87%로 상승했고 HumanEval의 선택 차이는 불확정이었다. 원래 확신도는 HumanEval 62.2%, MBPP 59.9%, BigCodeBench 78.5%의 문제에서 최상위 답이 동점이었기 때문에, 동점을 균등 확률로 처리하면 선택 개선폭은 8.79, 10.60, 12.75 퍼센트포인트가 된다. 보정이 좋아졌다고 모든 하위 지표가 좋아지는 것은 아니라는 점도 논문이 명시한다.

반대 방향의 결과도 있다. 이력 없이 단일 벤치마크에서 시작하는 비교에서는 MARGIN이 HumanEval·MBPP에서 감쇠 히스토그램보다 ECE가 낮았을 뿐 나머지 넷과는 불확정이었고, BigCodeBench에서는 온라인 Platt, 슬라이딩 윈도 히스토그램, 두 윈도 정확도 변형이 MARGIN보다 ECE가 낮았다. 9개 클라우드 부분집합으로 좁혀도 네 개의 패배는 유지되므로 모델 풀 크기만으로 설명되지 않는다. 피드백 가용성도 조건이다. 모든 응답자에게 정오답을 주는 대신 코디네이터가 고른 응답자만 검증하는 진단에서는 ECE가 전체 피드백 대비 약 30~34 퍼센트포인트 나빠졌다(그 체제 안에서는 그래도 다섯 베이스라인보다 낮다). 파라미터 민감도로는 α=0.005가 BigCodeBench 전이에서 훨씬 나쁘고 α=0.08이 0.04보다 좋았으며, 축소 혼합을 제거하면 전이들에서는 불확정, 테스트 강화 조건에서는 더 낮은 ECE를 냈다. 밴드 수는 1~5개 구간에서 ECE 차이가 0.3포인트 미만이지만 10개와 20개는 2.9~6.9포인트를 높였다.

개발자 관점에서 실무 규칙은 세 가지다. 첫째, 여러 모델의 자기보고 확신도를 그대로 가중치로 쓰는 라우터나 앙상블은 모델별·확신 구간별 보정 없이는 역방향으로 작동할 수 있다. 둘째, 보정은 정답 여부를 관측할 수 있을 때만 성립한다. 실행 테스트로 검증 가능한 코드 생성처럼 결과 라벨이 싸게 나오는 파이프라인에서는 쓸 수 있지만, 선택한 응답자만 검증하는 구조에서는 이력이 편중되어 보정이 무너진다. 셋째, 온도 스케일링이나 Platt, 히스토그램처럼 한 번 맞춰 고정하는 사후 보정은 작업 분포가 바뀔 때 약해지고, 이력 없이 시작하는 콜드 스타트에서는 MARGIN이 항상 이기지도 않는다. 이미 학습된 보정을 새 워크로드에 적응시키는 상황과 처음부터 추정하는 상황을 구분해서 봐야 한다.

저자가 밝힌 한계는 다음과 같다. 정오답 피드백이 핵심 운영 조건이며, 전체 피드백이 불가능한 배포에는 탐색이나 오프폴리시 보정이 필요하지만 이 논문은 그것을 평가하지 않았다. 정리 1은 정상성과 i.i.d. 베르누이 가정 아래 두 학습률 EWMA 계열의 편향만 다루고, 비정상성에서의 MSE 최적성이나 하위 투표의 최적성을 주장하지 않는다. 실험은 아카이브된 모델 집단, 유지된 과제 지원, 급격한 워크로드 전이에 한정되며 점진적이거나 반복적인 드리프트는 검증되지 않았다. 테스트 강화는 같은 과제를 재사용하므로 독립적인 미학습 일반화 검증이 아니다. 제공자, 모델 능력, 양자화, 서빙 구성이 독립적으로 변주되지 않았고 확신도 역전의 서빙 원인도 규명하지 못한다. 앙상블이 더 강한 단일 모델을 낮은 추론 비용으로 배포하는 것보다 낫다는 주장도 하지 않는다. 코드와 분석 데이터는 공개되지 않았다.