희소 앵커링 선형모델로 분류와 회귀를 아우르는 확률적 설명 프레임워크
Probabilistic Linear Explanations
무엇인가
이 논문은 블랙박스 모델의 개별 예측에 수학적 근거를 갖춘 설명을 만들되, 사람이 감당할 수 있는 크기로 줄이는 문제를 다룬다. 형식적 설명가능성(formal explainability)의 전통적 도구인 abductive explanation은 예측을 논리적으로 함의하는 특성 부분집합을 찾지만, 실제로는 관련 특성이 너무 많아 인지 한계를 넘는 경우가 흔하다. 확률적 완화(probabilistic explanation)는 이를 '높은 확률로 예측을 결정하는 작은 부분집합'으로 바꿔 완화하지만, 지금까지는 범주형 분류에 사실상 국한되어 있었다. 저자들은 이 범위를 이진 분류와 연속 회귀까지 확장하는 통합 프레임워크를 제안한다.
어떻게 동작하나
핵심 구성은 데이터 인스턴스를 불리언 하이퍼큐브 {-1,+1}^d의 벡터로 사상하고, 설명을 부분집합이 아니라 희소 선형함수 w ∈ R^d로 정의하는 것이다. 이때 w는 두 제약을 만족해야 한다. 하나는 앵커링(anchoring) 조건 w·x = f(x)로, 설명이 문제의 인스턴스 x에서 블랙박스 출력과 정확히 일치하도록 강제한다. 다른 하나는 희소성 예산 ||w||_0 ≤ k다. w가 지지집합 S 밖에서 0이므로, S에서 x와 일치하는 모든 z는 w·z = w·x를 만족한다. 즉 선형 설명은 부분집합 설명을 엄격히 일반화하며, 계수가 상쇄 효과를 허용할 때는 부분집합이 표현하지 못하는 더 넓은 영역을 담는다. 손실은 정규화된 조건부 이차손실 ℓ(y,y') = (1/4)(y-y')^2를 쓰는데, 이진 레이블 {-1,+1}에서는 0-1 분류 오차와 정확히 일치한다. 목표 (P2)는 w·z = w·x라는 조건 아래에서 f(z)와 f(x)가 달라질 확률, 즉 relevance error를 최소화하는 것이다.
무엇과 다른가
저자들은 신경망 블랙박스에 대해 (P2)의 최적해를 구하는 것이 NP^PP-난해임을 증명한다. 그래서 조건부 목표를 비조건부 대리 목표인 fidelity error (P3)로 바꾼다. 두 오차를 연결하는 것은 국소 분포족 D(z) ∝ exp(-(σ/2)||z-x||_1)이며, 여기서 ||z-x||_1/2는 해밍 거리, σ는 국소성 농도 파라미터다(σ=0이면 균등분포). 이 분포족에서 임의의 k-희소 설명의 relevance error는 fidelity error의 (1+e^{-σ})^k배 이하로 유계된다. 실무적으로는 m개 샘플로 기대 fidelity를 근사한 (P4)를 푸는데, 이는 고전적 부분집합 선택/희소 회귀를 일반화한 NP-난해 문제다. 저자들은 두 가지 해법을 제시한다. MIP(혼합정수계획) 정식화는 표본 복잡도가 k, 1/ε, log d에 다항이고 σ와 무관하게 유지되면서 경험적으로 최적해를 보장한다. IHT(반복 하드 임계화)는 각 반복에서 k-희소성 제약과 앵커링 초평면의 교집합으로 투영하며, 이 투영은 O(d log d + k^2)에 정확히 계산된다. 다만 IHT의 표본 복잡도는 cosh^4(σ/2), 즉 큰 σ에서 e^{2σ}로 증가하고 근사 계수도 나빠진다. 그래서 σ가 큰 국소 영역에서는 MIP가, 둘 다 감당 가능한 중간 영역에서는 IHT가 유리하다는 것이 저자들의 정리다.
어떻게 쓰나
실험은 분류와 회귀 과제에서 LIME, MAPLE과 비교한다. Adult, COMPAS, California Housing, Student Performance, NCI 60 Thioguanine, Cancer Drug Resp. Meth. 같은 벤치마크가 쓰였다. MAPLE은 희소성 예산 k를 일관되게 초과하고 앵커링 조건도 자주 위반한다. LIME은 k는 지키지만 앵커링에서 체계적으로 벗어나, 설명 대상 인스턴스 x에서 블랙박스 예측 f(x)를 재현하지 못한다. LIME이 더 큰 가설공간을 쓰기 때문에 경험적 fidelity error는 더 낮을 때가 있는데, 저자들의 측정에 따르면 이 이점은 앵커링 위반에서 직접 비롯된다. k=5, σ=1.0에서 이론적 상수 (1+e^{-σ})^k는 4.79인데, 측정된 relevance/fidelity 비율은 IHT가 1.95, MIP가 1.90을 넘지 않았고 모든 분류 벤치마크에서 1 미만이었다. 반면 LIME은 NCI 60 Thioguanine에서 4.00, Cancer Drug Resp. Meth.에서 5.22까지 올라가 이론적 상한을 넘어선다. k를 1에서 8로 늘리면 IHT와 MIP의 relevance는 모든 벤치마크에서 단조 감소했고, LIME은 모든 예산에서 두 방법보다 높았으며(California Housing과 Student Performance에서 약 1.3배, Adult에서 약 1.5배) COMPAS에서는 비단조여서 k=8에서 MIP의 약 4배였다. σ를 0에서 1.75로 올리면 세 벤치마크에서 relevance가 꾸준히 줄었고(Adult 약 3배, 회귀 두 과제 1.7배), 변환 계수는 σ=0의 32에서 σ=1.75의 2.23으로 좁혀졌다. 표본 수 m을 10^2에서 10^5로 늘리면 relevance는 첫 구간에서 급감한 뒤 California Housing과 Student Performance는 m=1000, Adult와 COMPAS는 m=5000에서 평탄해진다. LIME의 곡선은 처음부터 평평하고 불규칙하며 COMPAS와 Adult에서는 비단조다. 네 벤치마크 모두에서 m=100만 쓴 IHT와 MIP가 m=10^5을 쓴 LIME보다 낮은 relevance를 기록했다.
전제와 한계
실무 관점에서 이 논문이 주는 메시지는 두 가지다. 첫째, LIME이나 MAPLE 같은 모델 불가지론적 선형 설명기를 쓸 때 '설명이 x에서 모델 출력을 재현하는가'(앵커링)와 '희소성 예산을 지키는가'를 반드시 확인해야 한다. 이 논문의 측정에 따르면 두 조건을 만족하지 않는 설명은 평균적으로는 그럴듯해 보여도, 정작 사용자가 읽는 지지집합 위에서는 신뢰할 수 없다. 둘째, 회귀 문제처럼 예측의 크기와 방향을 함께 설명해야 하는 경우 부분집합 기반 설명은 정보가 부족하다. 예를 들어 대출 금리 8%를 설명할 때 DTI 조건이 -3포인트, 신용기간 조건이 +11포인트를 기여해 부분 상쇄된다는 사실은 특성 부분집합만으로는 전달되지 않는다. 구현 측면에서는 MIP가 중간 차원에서 최적성을 인증하는 반면 IHT가 훨씬 빠르고 고차원까지 확장되므로, 차원과 국소성 파라미터 σ에 따라 둘 중 하나를 고르는 것이 합리적이다.
저자들이 명시한 한계도 분명하다. 선형 설명은 특성 간 상호작용을 모델링하지 못한다. 다음 단계로 저차 다항식 설명을 제안하는데, 차수 q의 단항식에 대해 지수 k가 qk로 바뀌고 리프팅된 특징들이 의존성을 만들어 비등방성 공분산 구조가 되므로 기존 restricted eigenvalue 분석이 그대로 이전되지 않는다. relevance를 직접 최소화하는 것도 검토하지만, 조건부 사건이 w에 불연속적으로 의존해 목표가 초평면 배열 위에서 조각별 상수가 되고, 정확한 정식화는 표본마다 지시자를 요구해 목표가 선형형들의 비가 된다. 또한 프레임워크는 불리언 하이퍼큐브에서 동작하므로 희소성 예산 k가 지시자 리터럴을 세는 반면 사용자는 속성 단위로 생각한다는 간극이 있다. 좌표 독립성 가정을 완화하면 5.1절의 공분산 등방성이 깨진다. 이론적 보장 자체도 보수적이다. Adult에서 ε=10^-2, δ=0.05일 때 정리 3이 요구하는 표본 수는 약 10^11으로, 실무에서 충분한 10^3보다 여덟 자릿수 크다. (B+1)^4 항(B = k + 4√(k/α))이 이 격차의 대부분을 차지하며, 이는 모든 k-희소 설명에 균일하게 성립하는 상한과 최악의 restricted curvature에 대한 비용이다.