HarmBench 안전 점수는 단일 속성을 측정하지 못한다
Searching for "Harmful Refusal": A Psychometric Audit of an AI Safety Benchmark
무엇인가
AI 안전 리더보드는 모델의 안전성을 하나의 숫자로 요약해 배포 전 평가, 조달 지침, 모델 카드에 쓴다. 그런데 그 숫자가 실제로 무엇을 재는지는 거의 감사되지 않는다. 이 논문은 HELM Safety의 'LM evaluated harmfulness score'를 측정 도구로 취급하고, 그 점수가 'harmful refusal'(위험하거나 정책을 위반하는 요청을 거절하는 성향)이라는 단일 구성개념(construct)을 재는지 검증한다. 심리측정학의 구성타당도 틀에 따르면 시험이 어떤 속성을 측정하려면 그 속성이 먼저 존재하고 그것이 문항 응답을 인과적으로 만들어야 한다. 저자들은 이 조건이 성립하는지를 두 개의 심리측정 검사로 확인한다.
어떻게 동작하나
먼저 HELM Safety v1.17.0(2026년 6월 21일 접근)의 문항별 판정 점수를 쓴다. 두 개의 LLM 심사자(gpt-4o-2024-05-13, llama-3.1-405b-instruct-turbo)가 5점 루브릭으로 매긴 점수를 1.0에서 엄격하게 이진화해 만장일치 만점만 통과로 처리한다. 이 기준에서 HarmBench는 400문항 중 2개를 잃고 81개 모델 × 398문항 행렬이 된다(n < p). harmful refusal을 겨냥할 만한 HELM Safety의 데이터셋 네 개 중 AnthropicRedTeam, SimpleSafetyTests, XSTest의 유해 하위집합은 평균 통과율이 0.92~0.94로 포화되어 거의 모든 모델이 거의 모든 문항을 통과한다. 문항 수준 모델링이 가능한 것은 통과율 0.67인 HarmBench뿐이다.
무엇과 다른가
첫 번째 검사는 응답 행렬 내부를 본다. 단일 구성개념이 응답을 만든다면 하나의 잠재 차원이 통과·실패 패턴의 대부분을 설명해야 한다. 저자들은 탐색적 2PL 다차원 문항반응이론(MIRT) 모델을 1차원부터 10차원까지 적합하고, 확인적 MIRT로 3차원 응답과정 모델(standard 199문항, contextual 99문항, copyright 100문항)과 7차원 HarmBench 유해 도메인 모델을 세운다. 5번의 반복된 80/20 응답 수준 분할에서 각 모델-분할 조합마다 20번 무작위 초기화를 돌려 훈련 로그우도가 가장 높은 적합을 남기고, 홀드아웃 로그손실을 주 기준으로, Brier 점수를 보조 기준으로, AIC/BIC를 표본 내 간결성 점검으로 쓴다. 두 번째 검사는 응답 행렬에 전혀 없는 메타데이터, 즉 모델을 만든 개발자를 쓴다. harmful refusal만이 응답을 만든다면 전체 거절 능력이 같은 두 모델은 어느 문항이든 같은 방식으로 답해야 한다. 개발자 집단을 8개 이상 모델을 가진 그룹으로 제한해 OpenAI 21개, Anthropic 11개를 비교하고, 폐쇄/API 모델과 오픈웨이트류 모델도 비교한다. 주 검사는 세 개의 능력 구간 안에서 수행하는 Mantel-Haenszel(DIF)이고, 연속 적합 능력을 쓰는 릿지 페널티 로지스틱 검사가 민감도 점검으로 붙는다. 플래그 기준은 그룹 라벨을 고정한 채 적합된 IRT 모델에서 5,000개의 무-DIF 응답 행렬을 시뮬레이션해 얻은 최대 통계량이다.
어떻게 쓰나
결과는 단일 차원을 강하게 반박한다. Bernoulli 귀무 고유값 점검에서 주 고유값 외에 여러 후속 고유값이 무작위 기준선을 넘는다. 탐색적 MIRT에서 1차원 2PL의 홀드아웃 로그손실은 0.470(SD 0.003)인데 2차원부터 10차원까지는 모두 약 0.28로 급격히 좋아진다. 확인적 모델에서는 7차원 유해 도메인 모델이 0.255(SD 0.006)로 근소하게 최고지만, 3차원 응답과정 모델이 0.258(SD 0.006)로 거의 같으면서 더 적은 모수를 쓰고 AIC/BIC에서 이긴다. 가장 강한 단일 차원 모델인 3PL은 0.322(SD 0.007)로, 3차원 모델은 로그손실을 평균 0.064(SD 0.003, 범위 0.060~0.067) 줄이고 5개 분할 모두에서 이긴다. Brier 점수도 0.096(SD 0.002)에서 0.078(SD 0.002)로 떨어지며 짝지은 감소는 0.0176(SD 0.0005)이다. 분할 내 20개 초기화의 표준편차는 1차원 3PL 0.00037, 3차원 0.00035로 어떤 분할에서도 두 모델의 재시작 범위가 겹치지 않는다. 요인 상관은 3차원 모델에서 standard와 contextual이 0.785, copyright가 이들과 각각 0.451과 0.603이다. 7차원 모델에서 copyright 외 도메인들은 대체로 0.65~0.85로 묶이지만 copyright는 0.34~0.64로 낮다. copyright 문항을 제거한 후속 분석에서도 2차원 모델이 1차원보다 5개 분할 모두에서 나았고(0.278 대 0.293, 짝지은 감소 평균 0.0149), Brier도 0.0851 대 0.0891로 개선됐다.
전제와 한계
개발자 연계 DIF는 단일 점수에서 13개 문항(Mantel-Haenszel)과 17개 문항(로지스틱)이 플래그된다. 그런데 3차원 응답과정 점수로 나눠 같은 범위 안에서 매칭하면 플래그가 1개와 2개로 줄고, 7차원 점수에서도 대부분의 도메인에 개발자 DIF가 남지 않는다. 유일하게 눈에 띄는 잔여 사례는 cybercrime/intrusion(2개 MH, 4개 로지스틱)과 misinformation/disinformation의 로지스틱 1개다. 저자들은 이 감소가 집계 효과와 일치하지만 원인을 확정하지는 못한다고 말한다. 범위별 능력 추정이 검사 대상 문항 자체를 쓰기 때문에 도메인 특화 개발자 차이를 흡수할 수 있어서다. 폐쇄/API와 오픈웨이트류 비교에서는 평균 점수가 0.776 대 0.507로 크게 벌어지는데도 어떤 점수 체계에서도 family-wise 플래그가 나오지 않는다. 이는 한쪽이 전반적으로 더 안전하다는 뜻이 아니라, 문항 수준 집단 차이가 어떤 능력 추정으로 매칭하느냐에 달려 있다는 뜻이다.
실무적으로 이 논문이 주는 교훈은 안전 점수를 인용할 때 그 점수가 단일 속성을 잰다는 주장을 먼저 확인하라는 것이다. HarmBench의 copyright 문항이 대표적이다. 모델이 보호된 텍스트를 재현하는지는 훈련 중 무엇을 외웠는지에 주로 달려 있고, 요청을 유해하다고 판단해 거절하는 성향과는 다른 행동이다. 이 둘을 평균 내면 거절 성향과 암기라는 두 동인이 한 숫자에 섞인다. 논문이 제안하는 두 검사는 문항 수준 응답을 공개하는 벤치마크라면 어디에나 적용할 수 있고, 차원성 검사는 응답 행렬만, 능력 매칭 DIF는 모델 패밀리 같은 그룹 라벨만 있으면 된다. 저자들은 비용이 저렴하고 빠르다고 말한다. 따라서 모델 릴리스마다 돌려서 점수의 단일 속성 해석이 성립하는지 확인하고, 성립하지 않으면 행동을 분리한 좁은 해석을 쓰는 편이 안전하다.
저자들이 밝힌 한계는 분명하다. 모델 풀은 개발자별로 뭉친 81개 편의 표본이고 개발자 그룹이 작아(OpenAI 21, Anthropic 11) DIF 결과는 이 스냅샷의 모델들에 대한 진술이지 두 개발자에 대한 일반 주장이 아니다. 같은 개발자의 모델들은 훈련 파이프라인을 공유해 독립적인 피험자가 아니므로 단일 점수에서 관찰된 개발자 DIF가 부풀려졌을 수 있다. 문항 점수는 두 LLM 심사자가 매긴 것이라 그 편향을 물려받고, 실패 문항은 정답이 아니라 심사자의 판단이다. HarmBench 원래의 분류기 기반 공격 성공률 파이프라인으로 재현하지 않았으므로 결론은 HELM의 운영화에 적용된다. 5점 루브릭을 엄격한 임계값에서 이진화한 것도 보수적이지만 점수의 단계를 버린다. 또한 저자들은 단일 차원이 아니라는 것만 보였을 뿐 정확한 차원 수를 확정하지 않았고, 3차원과 7차원이 비슷하게 예측한다는 점을 인정한다. 마지막으로 증거는 한 벤치마크의 한 릴리스에 대한 것이고, 두 검사가 다른 벤치마크에도 돌아간다는 점은 아직 보이지 않았다.