테스트 시점 프롬프트 튜닝의 과신을 제로샷 신뢰도로 보정하는 사후 온도 스케일링
Bridging the Confidence Gap: Temperature Scaling for Calibrating Test-Time Prompt Tuning
무엇인가
이 논문은 테스트 시점 프롬프트 튜닝(TPT)이 제로샷 CLIP보다 정확도를 올리면서도 과신(overconfidence) 때문에 calibration이 나빠지는 문제를 다룬다. 기존 calibration 방법들은 텍스트 임베딩의 분산을 키우는 정규화 항을 추가해 ECE를 낮추지만, 그 대가로 TPT의 정확도를 떨어뜨린다. 유일한 사후 보정 방법인 SaLS는 정확도를 보존하지만 calibration 개선 폭이 제한적이다. 저자들은 제로샷 CLIP이 잘 calibrated되어 있고, TPT의 miscalibration은 예측 성능 변화보다 confidence inflation에서 온다고 본다. 이를 확인하려 TPT의 예측 클래스는 유지하고 confidence만 제로샷 confidence로 바꾸는 Confidence Replacement(CoR) 실험을 했고, ECE가 크게 줄어 SaLS와 C-TPT를 능가하지만 SoC에는 못 미친다. 다만 클래스는 TPT 분포에서, confidence는 제로샷 분포에서 오는 불일치가 있어, 일관된 확률분포를 유지하며 TPT confidence를 제로샷 confidence에 맞추는 원리적 방법이 필요하다고 주장한다.
어떻게 동작하나
제안하는 CoTS는 adaptation 이후에만 적용되는 사후 온도 스케일링이다. TPT 로짓 z^tpt(x)와 제로샷 로짓 z^zs(x)가 있을 때, 학습 가능한 온도 τ로 TPT의 softmax confidence를 조정해 제로샷 confidence와 맞춘다. 목적식은 τ* = argmin_τ (1/|Ω|) Σ_{i∈Ω} (max_k p̂^tpt_k(A_i(x);τ) - max_k p^zs_k(A_i(x)))^2 이다. 여기서 Ω는 weak augmentation을 제외하고, adaptation 후 entropy가 threshold γ' 이하인 strong augmented view들의 집합이다. 즉 여러 강한 증강 뷰에서 TPT의 최대 확률과 제로샷의 최대 확률 차이를 제곱해 평균한 손실을 최소화하는 τ를 찾는다. 최적 τ*는 weak view A_1(x)에 적용되어 p̂^tpt(A_1(x);τ*)를 최종 calibrated 확률로 낸다. 프롬프트 최적화 목적식을 건드리지 않고 로짓만 재조정하므로 TPT의 예측 클래스와 정확도를 바꾸지 않는다. 라벨 있는 검증셋이 없는 episodic TTA에서 제로샷 confidence를 label-free 기준으로 쓴다는 점이 핵심이다.
무엇과 다른가
E-CoTS는 CoTS에 weak-strong ensemble을 결합한 변형이다. TPT가 여러 증강 뷰를 만들 수 있다는 점을 활용해, weak view 예측과 선택된 strong view들의 평균 예측을 가중 평균한다. p_ens = α p^tpt(A_1(x)) + (1-α) (1/|Ω|) Σ_{i∈Ω} p^tpt(A_i(x)) 이다. 가중치 α는 K개 정규화된 텍스트 임베딩 사이의 평균 pairwise cosine similarity, 즉 α = (1/(K(K-1))) Σ_{i≠j} t_i^T t_j 로 정한다. α가 크면 클래스 간 텍스트 임베딩 유사도가 높아 entropy 기반 뷰 선택이 덜 변별적이므로 weak view에 더 큰 가중을 준다. α가 작으면 strong view들이 더 신뢰할 만하므로 그쪽에 가중을 준다. 이 앙상블만 적용하면 정확도는 오르지만 잘 calibrated된 성질이 깨질 수 있어, 각 확률 벡터를 CoTS로 온도 보정한 값으로 대체한다. p̂_ens = α p̂^tpt(A_1(x);τ*) + (1-α) (1/|Ω|) Σ_{i∈Ω} p̂^tpt(A_i(x);τ*) 가 최종 E-CoTS 출력이다.
어떻게 쓰나
실험은 11개 fine-grained 데이터셋(ImageNet, DTD, Flowers102, Food101, SUN397, Aircraft, OxfordPets, Caltech101, UCF101, EuroSAT, StanfordCars)과 4개 ImageNet 변형(ImageNet-A, ImageNet-V, ImageNet-R, ImageNet-K)에서 수행됐다. episodic test-time adaptation 설정으로 각 데이터 인스턴스를 독립적으로 적응시킨다. 백본은 ViT-B/16과 ResNet-50을 썼고, 비교 대상은 C-TPT, O-TPT, A-TPT, SoC 같은 정규화 기반 방법과 ZS-Norm, Penalty, SaLS 같은 로짓 조정 방법이다. 구현은 TPT 프로토콜을 따라 초기 프롬프트를 'a photo of a [CLASS]'로 두고 AdamW로 learning rate 0.005에서 한 번의 gradient step을 수행한다. 각 테스트 샘플마다 AugMix로 64개 증강 뷰를 만들고, weak view를 제외한 상위 10%(ρ=0.1) confident view를 골라 온도 파라미터를 50 step 학습한다. 결과는 세 랜덤 시드 평균이다.
전제와 한계
fine-grained 데이터셋에서 CoTS는 TPT의 평균 정확도를 유지하면서 평균 ECE를 11.30%에서 4.28%로 낮춰 모든 방법 중 가장 좋은 calibration을 보였다. Flowers에서는 CoTS가 제로샷보다도 낮은 ECE를 기록했다. 사후 보정 베이스라인인 SaLS보다 훨씬 낮은 ECE를 달성했고, E-CoTS는 평균 정확도를 더 높이면서 경쟁력 있는 ECE를 유지했다. ImageNet 변형에서는 정규화 기반 방법들이 ECE를 낮추는 대신 정확도를 희생한 반면, CoTS는 TPT의 평균 정확도를 보존하면서 평균 ECE를 절반 이하로 줄였다. E-CoTS는 평균 정확도 62.95%로 가장 높았고 ECE는 5.38%를 기록했다. 초록 기준으로 TPT의 ImageNet 변형 평균 ECE를 11.90%에서 5.38%로 낮추고, 정확도는 60.74%에서 62.95%로 올렸다. plug-and-play 실험에서 E-CoTS는 모든 베이스 방법의 정확도를 일관되게 개선했으며, O-TPT와 결합했을 때 ImageNet 변형 정확도를 57.51%에서 62.01%로 높였다. CoTS와 E-CoTS는 Penalty, C-TPT 같은 기존 방법과 결합해도 대체로 ECE를 추가로 낮췄다.
ablation에서 CoTS의 view selection은 weak view만 쓰면 calibration 개선이 제한적이고 ECE가 CoR보다 높을 수 있었다. strong augmented view를 쓰면 ECE가 크게 줄었고, Top-6 strong view 설정이 두 데이터 그룹에서 가장 낮은 ECE를 보였다. confidence alignment loss는 L2, L1 등 세 가지가 비슷했지만 L2가 fine-grained와 ImageNet 변형 모두에서 가장 낮은 ECE를 기록해 기본으로 채택됐다. E-CoTS의 ensemble weight α는 고정값보다 텍스트 임베딩 기반 adaptive weighting이 더 나았고, 특히 ImageNet 변형에서 그러했다. 추가로 CoOp 초기화, TTL과 TPS 같은 다른 episodic TTA 방법, ResNet-50 백본에서도 CoTS/E-CoTS의 calibration 개선과 정확도 유지 또는 향상이 일관되게 나타났다.
개발자 관점에서 이 방법은 이미 TPT나 episodic TTA를 쓰고 있고, 정확도는 유지하면서 confidence threshold 기반 의사결정의 신뢰도를 높이고 싶을 때 유용하다. 프롬프트 최적화를 다시 설계하지 않고 adaptation 뒤에 붙일 수 있는 post-hoc 모듈이며, 기존 calibration 방법 위에 plug-and-play로 얹을 수도 있다. 다만 전제가 있다. 라벨 있는 검증셋이 없어 제로샷 CLIP의 confidence를 calibration anchor로 쓰므로, 대상 도메인에서 제로샷 예측 자체가 잘 calibrated되어 있지 않으면 보정 기준이 흔들릴 수 있다. 또한 테스트 인스턴스마다 64개 증강 뷰를 만들고 온도를 50 step 최적화하는 비용이 들며, 여러 low-entropy strong view 선택에 의존한다. 논문은 별도의 한계 절을 두지는 않았지만, CoTS는 정확도를 주로 보존할 뿐 향상시키지 않고, E-CoTS의 앙상블은 CoTS와 결합하지 않으면 calibration을 해칠 수 있다는 점을 방법과 실험에서 드러낸다.