역할 상대적 역량 확률로 미지의 전문가에게 위임 여부를 정하는 RACER
RACER: Role-Aligned Competence Estimation for Human-AI Routing
무엇인가
이 논문은 학습 기반 위임(learning to defer, L2D) 문제를 다룬다. 예측 시스템이 각 입력에서 스스로 예측할지, 아니면 사람 전문가에게 넘길지를 결정하는 문제이며, 0-1 시스템 손실 아래 베이즈 규칙은 모델이 맞을 확률과 전문가가 맞을 확률을 비교한다. 논문이 겨냥하는 것은 전문가가 고정되어 있다고 가정하는 고전적 L2D가 아니라, 배포 시점에 처음 보는 전문가가 등장하는 population-adaptive L2D다. 교대 근무하는 판독의, 새로 채용된 사람, 다른 사이트에서 온 전문가를 상정하면 테스트 시점에는 그 전문가의 소량 컨텍스트 집합 C_e = {(x_i^C, y_i^C, m_i^C)}만 보고 위임 여부를 적응시켜야 한다. 기존 L2D-Pop은 질의 조건부 컨텍스트 인코더로 이 문제를 풀지만, 레이블과 전문가 예측을 고정된 클래스 좌표로 노출하기 때문에 특정 클래스 인덱스에서 전문가가 강하면 위임하는 식의, 전이되지 않는 지름길을 학습할 수 있다. 반대로 Identity-Free Deferral(IFD)은 역할 인덱스 기반 클래스별 역량 프로파일 θ_e,y로 이런 지름길을 제거하지만, 추정값이 클래스 안에서 상수라 같은 클래스 내에서 전문가가 어떤 사례는 잘 맞히고 어떤 사례는 못 맞히는 인스턴스 수준 전문화를 표현하지 못한다. 논문은 질의 의존적 적응과 아이덴티티 없는 전이를 동시에 얻는 것을 목표로 한다.
어떻게 동작하나
RACER는 분류, 전문가 역량 추정, 라우팅을 분리한다. 핵심 객체는 후험 예측적 역량 함수 Γ(x, y, C_e) ∈ [0,1]로, 컨텍스트 C_e로 표현되는 전문가가 후보 클래스 역할 y 아래 질의 x에서 맞을 확률을 추정한다. 전문가의 전체 정답 확률은 이 역할별 역량을 모델 후험과 결합해 얻는다. 컨텍스트 후험 불변성 조건 Y ⊥ C_E | X 아래 q*(x, C_e) = Σ_y η_y(x) Γ*(x, y, C_e)가 되고, 여기서 Γ*(x, y, C_e) = P(M_E = y | X=x, Y=y, C_E=C_e)다. 즉 L2D-Pop이 라우팅 마진 안에 숨겨둔 전문가 역량을 RACER는 확률 스케일의 추정 대상으로 끌어낸다. 구현은 두 가지다. RACER-KNN은 각 후보 클래스 안에서 k-최근접 이웃으로 전문가 정답률을 비모수적으로 추정한다. 기본 구현인 RACER-kernel은 커널 가중 컨텍스트 요약과 분류기 통계량(서포트, 유사도 질량, 후험 신뢰도, 엔트로피, 전역 컨텍스트 정확도)에 학습된 역량 네트워크를 적용한다. 두 추정기 모두 후보 역할 관계, 공유 집계, 대칭 요약만 사용하고 절대적 클래스 아이덴티티 채널은 배제한다. 역량 헤드는 이진 교차 엔트로피 같은 strictly proper 전문가 정답 손실로 학습되어 조건부 정답 확률을 향하게 하고, 최종 위임 결정은 1단계 L2D 대리 손실로 최적화한다. 논문은 이미지 전용 분류기를 고정하는 주 프레임워크 외에 클래스 후험을 컨텍스트에 조건화하는 확장(RACER-C)도 다루며, 어느 쪽도 테스트 시점 파라미터 업데이트를 요구하지 않는다. 이론적으로는 일관된 클래스 재라벨링 불변성, 베이즈 정합 위임 대리손실, 그리고 라우팅 후회를 분류기 오차와 역량 추정 오차에 연결하는 플러그인 후회 상한을 제시한다.
무엇과 다른가
실험은 통제된 합성 전문가 벤치마크와 실제 판독의 벤치마크로 나뉜다. PathMNIST 조직병리 컨텍스트 스케일링 실험은 K=9, 완전한 서브타입 의존(ρ=1), 완전한 전문가 프로파일 순열(λ_id=1), 좋음/중간/나쁨 서브타입 정확도 (0.98, 0.70, 0.30)로 설정하고 컨텍스트 크기 B를 9, 25, 50, 100, 200, 500, 1000으로 늘린다. B/K=1에서는 모든 적응형 방법이 분류기 신뢰도 라우터보다 낮았는데, 같은 역할의 컨텍스트가 너무 희박하기 때문이다. RACER-kernel은 B/K가 약 5.6인 지점에서 분류기 베이스라인을 넘어서고, B/K=111에서 전체 AURSAC 이득 +0.0273, 명목상 미지 OOD 전문가에서 +0.0260, 미지 ID 전문가에서 +0.0280을 기록했다. RACER-KNN도 큰 컨텍스트에서 개선되지만 최종 이득은 학습된 커널 헤드의 약 절반이다. IFD-score와 IFD-MLP는 클래스별 프로파일 노이즈가 줄면서 소폭 개선되고, L2D-Pop QI/QC는 스윕 전 구간에서 분류기 베이스라인 아래에 머문다. 보정에서는 RACER-kernel의 Brier 점수가 전 구간에서 가장 좋아 B/K=1의 0.2251에서 B/K=111의 0.2029로 개선됐고, IFD 계열은 약 0.222에 접근했다. ECE는 IFD 계열이 최종적으로 가장 낮았지만 라우팅 효용과 Brier는 RACER-kernel이 더 좋았다. 커널 풀링 대신 순열 불변 신경망을 쓰는 RACER-DeepSets와 비교해도 RACER-kernel이 우세해, B=1000에서 최종 AURSAC 이득 +0.0273 대 +0.0194, Brier 0.2029 대 0.2197이었다. CIFAR-100에서는 K=20과 K=100 설정에서 RACER-kernel이 분류기 신뢰도 라우팅 대비 (ρ, λ_id, seed)로 짝지은 셀에서 11/12, 11/12, 11/12, 12/12로 더 높았다. 보정 스트레스 테스트에서는 RACER-kernel이 모든 K/프로파일 설정에서 최저 Brier와 ECE(ECE 0.013~0.021)를 기록했고, 강한 OOD 전문가에서 평균 예측 정답률 q̂=0.6712가 실제 정확도 0.6696(K=20), q̂=0.6745가 0.6709(K=100)에 근접했다. IFD-score는 같은 조건에서 0.5352로 과소확신이었다.
어떻게 쓰나
실제 전문가 벤치마크는 VinDr-CXR과 CheXpert다. VinDr-CXR은 실제 판독의가 참여한 다중 레이블 위임 벤치마크로, 각 소견을 이진 관련성 과제로 취급하고 매크로 AURSBAC을 보고한다. 공식 테스트 레이블에 판독의 아이덴티티가 없어서 전문가 e의 위임 예측은 e 자신의 레이블, 목표는 나머지 두 판독의의 leave-one-radiologist-out 합의로 두고, R8/R9/R10 클러스터를 OOD 전문가 그룹으로 다루는 co-annotation-cluster 홀드아웃을 쓴다. 5-시드 요약에서 RACER-C가 풀링된 전역 예산 AURSBAC, 최저 Brier, 최저 ECE, 양의 컨텍스트 후험 NLL 이득을 보였지만, 그룹 조건부 seen 및 미지 OOD 열에서는 RACER-kernel이 더 강했고 그룹 가중 AURSBAC도 0.7012 대 0.6950으로 높았다. 이 벤치마크에서는 분류기 신뢰도 베이스라인도 강한데, 위임 대상 판독의의 원시 정확도가 전체 97.00±0.03%, 미지 ID 98.62±0.41%, 미지 OOD 96.28±0.04%로 매우 높고 이미지 전용 분류기는 전체 90.26±0.04%, 미지 OOD 87.80±0.06%이기 때문이다. CheXpert는 사람 판독의와 외부 AI 시스템(CARZero, KAD, CheXZero)이 동시에 위임 대상으로 존재하는 다중 전문가 설정이며, 주 지표는 seen-plus-unseen 매크로 AURSBAC이다. 사람 판독의 3명, 홀드아웃 AI 3가지, 시드 3개로 방법당 27개의 짝지은 셀을 만들었고, 두 학습형 RACER 변형이 가장 강했으며 평균은 거의 동일했다. RACER-kernel이 seen 전문가에서 약간 더 강해 주 방법으로 남는다.
전제와 한계
개발자 관점에서 이 논문의 실용적 메시지는 전문가 인터페이스를 설계하는 방식이 전이 성능을 좌우한다는 것이다. 클래스 인덱스를 그대로 입력에 노출하는 컨텍스트 인코더는 학습 분포에서 좋은 라우팅 마진을 만들 수 있지만, 전문가가 바뀌면 그 마진이 무엇을 근거로 만들어졌는지 알 수 없다. RACER처럼 역할 상대적 특징만 남기고 역량을 확률로 명시하면 위임 예산을 스윕하거나 임계값을 고르거나 여러 전문가를 비교할 때 쓸 수 있는 점수가 생긴다. 특히 라우팅 점수 최대화와 확률 보정이 다르다는 지적은 실무에서 중요하다. 논문의 PathMNIST 결과에서 클래스별 프로파일은 ECE가 더 낮았지만 라우팅 효용은 더 나빴다. 배포 환경에서 컨텍스트 집합을 얼마나 확보할 수 있는지, 그리고 이미지 표현이 전문가 역량을 좌우하는 요인(서브타입, 촬영 사이트, 화질)을 실제로 분리해 주는지가 이 방법이 작동할지의 전제다.
저자들이 밝힌 한계는 분명하다. 첫째, 방법은 정보량 있는 질의-컨텍스트 기하에 의존한다. 이미지 표현이 전문가 역량을 결정하는 요인에 따라 사례를 정리해 주지 못하면 국소적 역할 상대 풀링은 올바른 역량 법칙을 복원할 수 없다. 둘째, 유한한 컨텍스트는 근본적 제약이며, 특히 K가 크고 기대되는 동일 역할 서포트 B/K가 작을 때 그렇다. 셋째, 실제 전문가 벤치마크는 지속적 판독자를 포함한다는 점에서 가치가 있지만 임상 과제와 주석 프로토콜의 범위가 제한적이고, 분류기 신뢰도가 여전히 경쟁력 있는 베이스라인으로 남는다. 넷째, 이 버전은 유의성 검정 없이 기술적 비교만 보고하므로 RACER-kernel의 더 높은 평균이 통계적으로 신뢰할 만한 우위를 뜻하지는 않는다. 다섯째, 보정은 지표 의존적이어서 Brier 점수는 예리하고 유용한 확률을, ECE는 더 매끄럽지만 덜 판별적인 추정을 선호할 수 있다. 또한 VinDr-CXR 평가는 다른 두 판독의와의 합의를 목표로 하며 독립적인 임상 정답을 측정하지 않고, 병원 이동(shift)은 검증되지 않았다. 코드는 출판 시 공개될 예정이다.