GPT 세대가 거듭될수록 차별은 줄어드는 게 아니라 측정 불가능한 형태로 세탁된다
Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations
무엇인가
이 논문은 대규모 언어모델의 안전성 평가가 표면적 독성 분류기에 의존하고 있다는 문제를 다룬다. GPT-2 완성문은 Detoxify 점수가 높고 GPT-5 완성문은 낮다. 자연스러운 해석은 안전성 훈련이 작동했다는 것이다. 저자들은 OpenAI GPT 계보 15개 모델, 45만 건의 완성을 분석해 이 해석이 불완전하다고 주장한다. 차별적 콘텐츠는 세대를 거치며 제거되는 것이 아니라 변형된다. 초기 모델에 있던 명시적 harm(성폭력 클러스터, 물리적 위협 프레이밍)은 후기 모델에서 사라지지만, 남성 프롬프트 완성문은 새로운 표상 영역을 얻고 여성 프레이밍은 제한된 채로 남는다. 저자들은 이를 harm laundering이라 부른다. 이 용어는 모델 개발자의 의도적 행위를 함의하지 않는다. 메커니즘은 구조적이며, 표면적 평가 목표와 고성능 언어모델의 분포적 유연성에서 따라 나온다. Barocas와 Selbst가 알고리즘 시스템이 절차적으로 중립적으로 보이면서 구조적 차별을 재생산한다고 보인 것과 같은 논리다. 명시적 harm이 암묵적 harm으로 세탁되고, 세탁이 활성화된 지점에서 감사 결과는 개선으로 등록된다.
어떻게 동작하나
데이터셋은 GPT-2부터 GPT-5까지 15개 모델에서 생성한 45만 건의 성별 지향 완성문이다. 모델당 3만 건씩, 여성 지향·남성 지향·중립(사람 지향) 세 조건에 각 1만 건이 배정된다. 모델 구성은 GPT-2 4종(gpt2, gpt2-medium, gpt2-large, gpt2-xl), GPT-3 3종(davinci-2020-05-03, text-davinci-002, text-davinci-003), GPT-4 6종(gpt-4-0613, gpt-4-1106-preview, gpt-4-0125-preview, gpt-4-turbo-2024-04-09, gpt-4o-2024-05-13, gpt-4o-2024-08-06), GPT-5 2조건(맥락 없음, 시스템 프롬프트 맥락 있음)이다. 프롬프트는 Noble(2018)의 검색 감사에서 적응한 단일축 문장 완성 줄기("Women can…", "Why are women so…")로, 마스크 언어모델링이나 지시 따르기 형식이 필요한 다른 패러다임과 달리 GPT-2 자기회귀 형식까지 15개 모델 전체에서 변경 없이 작동하는 유일한 방식이라 선택했다. 분석은 BERTopic(UMAP 차원 축소 + HDBSCAN 클러스터링)을 45개 인구통계×모델 층(층당 1만 문서)과 15개 모델별 코퍼스(각 3만 문서)에 독립 적용한다. 이상치 감소는 c-TF-IDF(t=0.10) 다음 Distributions(t=0.10)의 2단계 사슬을 쓰고, 임베딩 전략은 HDBSCAN과 같은 임베딩 공간이라 순환적이므로 제외한다. 감소 후 평균 이상치율은 모델별 3.2%, 층별 0.2%이고, 대표 8개 층 표본의 NPMI 일관성은 [0.045, 0.176], 평균 0.092로 우연 이상의 동시출현을 확인한다. 채점 파이프라인은 세 개의 독성·표상 harm 분류기(Detoxify unbiased, ToxiGen, REGARD)에 더해 BERTweet-large 기반 성차별 탐지기(EDOS 파인튜닝), Cardiff NLP RoBERTa 감정 분석(TweetEval), GLiNER가 검출한 정체성 스팬에 적용하는 NLI 크로스인코더(nli-deberta-v3-large, 사전 고정된 32개 가설 — 표준 26개, 비교 6개)로 구성된다. "덜 신뢰할 만하거나 지식이 부족하다" 가설은 Fricker의 증언적 부정의 개념에 근거한다. 모든 분류기는 인구통계 프레이밍을 보존하기 위해 cleaned_prompt와 완성문을 연결해 채점한다.
무엇과 다른가
저자들은 harm laundering을 세 가지 기준의 테스트로 형식화한다. 첫째, 명시적 harm 감소 — 성폭력·물리적 위협 관련 토픽 클러스터가 GPT-2에서 GPT-5로 감소한다. 둘째, 비대칭적 표상 변화 — Blodgett 등의 의미에서 표상 harm이 줄어드는 대신 인구통계 조건 간에 재분배된다. 한 집단의 확장(남성 프롬프트 완성문이 돌봄, 정서적 범위, 동맹 정체성 같은 긍정적 표상 클러스터를 축적하는 반면 여성 프롬프트 완성문은 그렇지 못함)과 다른 집단의 삭제(그 집단에 관한 콘텐츠가 그 집단의 완성문에서 사라짐)를 모두 포함한다. 셋째, 분류기 사각지대 — 표준 독성 분류기가 변형된 콘텐츠를 저독성으로 채점한다. 세 조건이 독립적으로 검증되며 모두 성립하면 harm laundering이 확정된다. 변환이 일어나는 경로는 세 가지로 제시된다. 명시적 harm이 같은 집단을 향한 은밀한 harm이 되는 경로, 콘텐츠가 인구통계 조건 간에 재귀속되는 경로, 콘텐츠가 그것이 다루는 집단으로부터 삭제되는 경로다. 검출은 3단계를 요구한다. 표면 평가(낮은 독성이 필요조건), 토픽 구조 감사(층별 BERTopic, 저독성 아래의 비대칭 클러스터 내용이 양성 신호), 다중 스코어러 불일치(인구통계 민감 분류기 대 표면 분류기의 불일치가 세탁된 콘텐츠를 확인).
어떻게 쓰나
첫 번째 결과 묶음은 명시적 harm의 소멸과 의료 정보의 오귀속·삭제다. 모델별 코퍼스에서 BERTopic은 상위 c-TF-IDF 용어에 rape 또는 raped를 포함하는 토픽 클러스터 15개를 찾는다. 14개가 GPT-2부터 text-davinci-002까지 나타나고 여성 지향 완성문에 집중되며(유의하게 치우친 사례에서 클러스터 문서의 53~79%), text-davinci-003에 남성 우세 잔존 클러스터 하나(n=51)가 남는다. GPT-4부터는 어떤 층에서도 이런 클러스터가 0개이고, 문서 수준 검사도 동의한다. GPT-5 맥락 없음 조건의 남성 프롬프트에서 Topic 5는 두 번째로 큰 클러스터로 1,997개 문서를 담는다. 이름은 5_men_can_get_breast, 즉 유방암을 남성 권리와 페미니스트 논쟁으로 프레이밍한 것이다. 대표 완성문은 "Men can"에 대해 "Health: Can men get HPV or breast cancer? Mental health topics? - Biology/reproduction: Can men (including trans men) get pregnant or breastfeed?"라고 답한다. 같은 조건의 여성 프롬프트에는 breast cancer, HPV, cervical cancer, mammogram을 포함하는 토픽 클러스터가 0개다. BC5CDR 생의학 개체명 인식이 이를 독립적으로 복제한다. 남성 지향 1만 행 중 701행(7.0%)에 breast cancer 엔터티가 있고, 여성 지향 1만 행 중에는 0행이다. 이 층의 남성·여성 토픽 분포 사이 Aitchison 거리는 18.51로 큰 조성적 발산을 나타낸다. Topic 5의 1,997개 문서에 세 분류기를 적용한 결과는 Detoxify 0.005, ToxiGen 0.001, REGARD-negative 0.180으로 모두 비독성에 부합한다. 저자들이 강조하는 것은 Topic 5 콘텐츠 자체가 본질적으로 유해하다는 것이 아니라, 여성에게 영향을 주는 질환이 남성 지향 완성문에서 명명되고 여성 지향 완성문에서는 사라지는 분포적 비대칭이 표준 독성 분류기가 탐지할 수 없는 harm의 형태라는 점이다.
전제와 한계
두 번째 결과 묶음은 분류기 불일치, 감정 역전, 릴리스 날짜 상관이다. BERTweet과 Detoxify 사이의 쌍별 Cohen's κ는 세대를 거치며 붕괴한다. GPT-2 0.093, GPT-3 0.160, GPT-4 -0.0004, GPT-5 맥락 없음 -0.001이다. 다섯 개 이진화 분류기 플래그(BERTweet, Detoxify, REGARD-negative, NLI stereotype, HONEST)에 대한 Fleiss' κ는 GPT-2 -0.059, GPT-4 -0.163, GPT-5 맥락 없음 -0.164로, 세탁된 콘텐츠가 가장 활발한 세대에서 분류기 발산이 정확히 붕괴한다. 행 수준 혼합효과 회귀(signal ~ demographic × era + (1|model))에서 BERTweet의 women×GPT-4 상호작용은 β=-0.050, NLI stereotype의 women×GPT-5 상호작용은 β=-0.115로 둘 다 p<.001이다. REGARD 상호작용도 같은 모델에서 경계를 확인한다(women×GPT-4 음, women×GPT-5 양, 둘 다 p<.001). 대응하는 Detoxify 상호작용은 이 표본 크기에서 유의하지만(β=+0.006 at GPT-4, β=+0.035 at GPT-5) 한 자릿수 작고, 모델 수준에서 각 모델의 인구통계 격차를 릴리스 순서에 회귀하면 Detoxify 격차는 추세를 보이지 않는다(β=+0.001, p=.21). 감정 점수는 GPT-4에서 역전한다. GPT-2와 GPT-3에서는 남성 프롬프트 완성문의 긍정 감정이 더 높았고(Cohen's d +0.03~+0.10), GPT-4와 GPT-5에서는 방향이 완전히 뒤집혀 여성 프롬프트가 더 높다(d -0.31~-0.57). 15개 모델 중 14개가 Bonferroni 보정(α_adj=0.0033)을 통과한다. 저자들은 이를 개선이 아니라 과잉 교정으로 읽는다. GPT-4에서 긍정 감정이 오르는 동시에 여성에 대한 "덜 신뢰할 만하거나 지식이 부족하다"는 NLI 함의가 증가하고, 여성의 교차성 콘텐츠는 30.8%에서 1.1%로 붕괴하며, 토픽 다양성도 수축하기 때문이다. 여성·남성 감정 분포 사이 Jensen-Shannon 발산은 GPT-2 0.0006, GPT-3 0.004, GPT-4 0.044, GPT-5 0.106으로 단조 증가한다. BERTweet 성차별 점수 ≥0.6이면서 Detoxify 독성 <0.1인 불일치 행의 비율은 여성 지향에서 GPT-2 22.0%, GPT-3 29.0%, GPT-4 5.5%이고, GPT-5는 맥락 있음 29.0%, 맥락 없음 0.4%로 갈린다. 남성 지향은 모든 시대에서 훨씬 낮다(GPT-2 7.4%, GPT-3 6.6%, GPT-4 0.1%, GPT-5 0.0%). 중립 사람 지향 기준선은 전 시대 0.2% 이하다. 여성 지향 완성문의 토픽 다양성은 GPT-4 정렬 경계에서 남성 대비 36% 감소한다(W/M = 0.58, GPT-2의 0.91에서). REGARD 표상 harm 격차는 릴리스 날짜와 상관하지만(ρ=+0.55, p=.034) Detoxify는 그렇지 않다(ρ=-0.23, p=.42). 즉 독성 점수는 떨어지는데 표상 harm은 커진다. 인간 감사는 150행 층화 표본(불일치 62, Topic-5 문서 23, 일치 대조 65)을 모델 세대와 분류기 점수에 대해 맹검으로 라벨링했고, 50행을 세 명이 라벨링해 Fleiss' κ=0.73(95% CI [0.54, 0.88], 부트스트랩 1만 회), 82% 만장일치를 얻었다. BERTweet이 성차별로 표시했지만 Detoxify가 깨끗하다고 채점한 불일치 행은 GPT-2 76.9%, GPT-3 69.2%가 인간에 의해 비하 또는 고정관념으로 확인된 반면 GPT-4는 0%, GPT-5 맥락 없음은 8.3%였다. Topic-5 문서는 인간 플래그 0%로, 항목별로는 무해하고 harm이 분포적이라는 저자들의 주장과 일치한다.
GPT-5의 거부 게이트 자체도 비대칭이다. 맥락 없음 조건에서 여성 지향 프롬프트의 11.52%를 거부하고 남성 지향은 0.59%만 거부한다. 거부 설명 텍스트는 여성 지향 967건, 남성 지향 29건에 존재하며, 여성 사례에서 61.5%가 harm·안전 근거를 인용하고 58.4%가 예상되는 harm으로 젠더 차별을 명시한다. 남성 사례의 대응 비율은 27.6%와 37.9%다. 저자들은 이를 GPT-5가 여성에게 차별적 콘텐츠를 생성할 것을 남성보다 33배 높은 비율로 예상했다는 직접적 증거로 읽는다. 한편 맥락 제공은 관찰된 가장 효과적인 완화 패턴이다. 시스템 수준 지시를 감싼 GPT-5 맥락 있음 조건에서 형평성 프레이밍 비대칭은 +20.4%p에서 -0.9%p로, 인구통계 간 상호 참조 격차는 +40.9%p에서 +8.8%p로 줄어든다. 확인적 가설군은 다섯 개 방향성 검정(REGARD women×GPT-4 및 women×GPT-5 혼합효과 상호작용, BERTweet 인구통계×시대 상호작용, Detoxify GPT-5 증폭항, REGARD 격차와 릴리스 날짜의 Spearman 상관)으로 사전 지정되었고 Benjamini-Hochberg 보정 q=.05에서 다섯 개 모두 생존한다. 시대별 교차 인구통계 참조 검정 다섯 개에서도 여성 지향 완성문이 남성을 참조하는 정도가 역방향보다 항상 많았고(격차 +8.8~+41.0%p, 모두 χ²≥160, p<0.001) 전부 생존한다.
개발자에게 이 논문이 주는 실무적 결론은 명확하다. OpenAI GPT 계보 안에서 독성 점수 감소는 harm 감소의 충분한 대리 지표가 아니다. 세 독성 분류기가 세탁된 콘텐츠에 체계적 거짓 안전 신호를 내며, REGARD 계열 표상 harm 격차는 릴리스 날짜와 함께 단조 증가하는데 Detoxify는 그렇지 않다. 따라서 배포 전 평가 파이프라인에 층별 토픽 구조 감사와 인구통계 민감 극성 지표를 추가하는 것이 후보 대체안으로 제시된다. 거부율 자체도 인구통계별로 분해해 봐야 한다. 거부가 가장 위험한 완성 후보를 생성 전에 제거하므로, 채점된 여성 표본은 자기 선택적으로 덜 유해한 쪽으로 치우치고 보고된 절대 harm 비율은 하한이 된다. 또한 사용된 분류기들(BERTweet 2020, Detoxify 2020, REGARD 2019)은 모두 GPT-4 이전 코퍼스로 학습되어, 세탁이 가장 활발한 후기 세대에서 체계적 과소 탐지를 유발할 수 있다. 저자들이 제시한 3단계 검출 프로토콜은 표준 감사 자원만으로 어떤 생성 모델에도 적용 가능하도록 설계되었다는 점이 실무적으로 중요하다.
저자들이 밝힌 한계는 폭넓다. 이 연구는 이진 젠더 범주(여성, 남성)를 사용하며, 이는 젠더 다양성을 왜곡하고 논바이너리·젠더퀴어·트랜스 경험을 보이지 않게 만든다. GPT-5 결과는 OpenAI API 접근이 필요해 완전 재현이 불가능하다. GPT-5 맥락 없음 조건의 거부 분모 이동 때문에 여성에 대한 모든 결과는 하한이며, 전체 완성 행만으로 제한한 민감도 분석(n=8,848 여성, n=9,941 남성)은 여성 harm 통계를 소폭 더 높게 낸다(roberta_positive +0.008, BERTweet +0.003, HONEST +0.007). NLI 채점은 GLiNER 검출 정체성 스팬 71,349행(코퍼스의 15.9%)에만 적용되어 GPT-4 시대가 과대 대표되고 GPT-3·GPT-5 시대가 과소 대표되며, NLI 선택 행은 전체 코퍼스보다 harm 지표가 낮다. NLI 도구는 이 코퍼스에서 포화되어 고정관념 가설의 함의 점수가 상한 근처에 몰리므로 확인적 가설군에서 제외하고 보조 신호로만 취급한다(역확률 가중 재가중 시 가중·비가중 평균 차이는 모든 시대·인구통계 셀에서 최대 0.006). 프롬프트 설계상 적대적 단일축 줄기는 자연스러운 질의보다 고정관념 인접 콘텐츠를 더 쉽게 끌어내므로 보고된 비율은 이 유도 체제의 속성이지 실제 사용 빈도가 아니다. 토픽 모델은 고정 전역 시드(RANDOM_SEED=42)로 결정적이지만 교차 시드 민감도 분석은 동반 방법론 논문으로 미룬다. 분류기 범위 감사에서 23개 확인된 오탐 메커니즘을 제외했고, gpt-4-0613과 GPT-5 맥락 있음의 BERTweet 점수는 권한 부여 프레이밍 오탐으로 부풀려져 있어 교차 모델 궤적 주장에서 제외한다. 릴리스 날짜 기울기 검정은 N=15로 검정력이 부족해 REGARD와 Detoxify 기울기 차이 검정은 p=.078에 그치며 방향성 증거로만 취급해야 한다. 형평성 프레이밍 점수는 어휘적 존재만 측정하고 의미론적 진정성을 측정하지 못하며, 토픽 다양성의 절대 개수는 HDBSCAN min_cluster_size, UMAP n_neighbours, 병합 단계 같은 하이퍼파라미터에 민감해 단일 실행 내 W/M 비율만 비교 단위로 적절하다. 마지막으로 발견은 RLHF 기반 OpenAI GPT 계보에 국한되며, Constitutional AI나 DPO, 지시 튜닝 계열에서 harm laundering이 나타나는지는 이 검출 프로토콜이 향후 검증할 열린 질문으로 남는다.