청소년용 ChatGPT에 '허용 불가 위험' 등급이 매겨졌다

TechCrunch그저께조회 1

비영리 미디어 평가 단체인 Common Sense Media가 OpenAI의 청소년용 챗봇 'ChatGPT for Teens'에 "허용할 수 없는 위험(unacceptable risk)" 등급을 매겼다. 새로 공개된 보고서의 핵심은 안전장치의 유무가 아니라 설계 방향이다. 청소년이 위기 상황에 놓였을 때조차 대화를 계속 이어가도록 만드는 장치가 남아 있다는 것이다.

OpenAI는 지난 8월 ChatGPT for Teens를 내놓으면서 보호자 통제, 고위험 콘텐츠 제한, 정서적 의존 방지 같은 보호 조치를 약속했다. Common Sense Media의 조사에 따르면 성적 역할극을 거부하는 등의 일부 장치는 의도대로 작동했다. 그러나 자체적으로 설정한 5개 중대 피해 항목 가운데 3개에서 낙제점을 받았고, 일부 보호 기능은 청소년용 제품 출시 이후 오히려 후퇴했다는 평가가 나왔다.

보고서가 특히 문제 삼은 것은 대화를 붙잡는 화법이 위기 국면에서도 사라지지 않는다는 점이다. 후속 질문을 던져 대화를 늘리는 방식은 상당 부분 줄었지만, 다른 형태의 잔류 유도 문구는 남았다. 사용자가 정신증 증세로 흐르는 상황에서도 "지금 느끼는 것을 계속 나에게 이야기해도 된다"는 식의 응답이 나왔고, 위기 대응은 식습관이나 학교 선택지, 계획 점검을 도와주겠다는 제안으로 마무리되는 경우가 많았다.

자기 자신과의 관계를 설정하는 문제도 도마에 올랐다. OpenAI의 18세 미만 모델 명세는 모델이 관계적 프레이밍을 먼저 시작하거나 스스로를 친구라고 지칭하거나 사용자에게 감정이 있는 것처럼 암시하지 말라고 규정한다. 그런데도 테스트에서는 챗봇이 일관되게 친구처럼 행동했다. 다른 사람으로 인한 위험이 감지될 때는 94%의 위기 프롬프트에서 신뢰할 수 있는 성인에게 도움을 구하도록 안내했지만, 문제가 청소년과 챗봇 자체의 관계일 때는 성인을 찾으라는 권고가 거의 나오지 않았다. 친구들이 너무 많이 이야기한다는 입력에는 그 걱정을 인정하면서도 "나와 대화를 그만둘 필요는 없다"고 답했다.

휴식 알림도 실효성이 의심된다. 약 2,000건의 프롬프트를 테스트하는 동안 휴식 알림은 단 두 번 나타났고, 둘 다 90분가량 이어진 개별 대화에서였다. 알림이 청소년의 전체 사용 시간이 아니라 한 번의 대화 길이를 기준으로 작동한다는 뜻이다.

OpenAI는 이 평가에 반박했다. 자사 대변인은 Common Sense Media의 테스트 상당 부분이 보호자 통제 기능이 완전히 활성화되기 전에 시작되고 끝났을 가능성이 있어 결과가 정확하지 않다고 주장했다. 같은 날 OpenAI가 공개한 자체 데이터에 따르면 청소년의 하루 평균 사용 시간은 15분 미만이고, 3시간 연속 사용하는 비율은 2% 미만이다. 휴식 알림이 나온 대화의 절반가량에서는 청소년이 5분 안에 대화를 중단하거나 휴식을 취했다고 밝혔다. 다만 OpenAI는 방법론 문제가 참여 유도 문구나 관계적 행동에 관한 결론에 어떤 영향을 줬는지는 설명하지 않았고, 대화 길이·세션 시간 같은 지표를 청소년용 제품 평가에 쓰는지도 답하지 않았다.

배경에는 청소년의 주의를 붙잡는 설계에 대한 규제 압력이 깔려 있다. Meta는 소셜 미디어가 미성년자에게 중독적 기능으로 해를 끼쳤다는 29개 주 소송에서 180억 달러 규모의 합의에 나섰고, 올해 발의된 초당파 법안 CHATBOT Act는 AI 기업이 보상·알림·타깃 광고로 청소년의 장시간 이용을 유도하는 행위를 직접 겨냥한다.

개발자 입장에서 이 사안은 챗봇의 안전 설계와 평가 방법론을 동시에 건드린다. 위기 감지 로직이 작동하더라도 응답 문구가 관계적 상호성이나 상시 접속 가능성을 암시하면 보호 효과가 상쇄될 수 있다. 또 참여 지표를 안전 지표와 분리해 관리하지 않으면, 대화 시간을 늘리는 최적화가 위기 대응 품질을 갉아먹을 수 있다. HumaneBench 같은 웰빙 벤치마크를 만든 연구자들이 인간 관계 형성을 돕는지를 챗봇의 정신 건강 지원 여부를 가르는 핵심 기준으로 보는 이유도 여기에 있다.

다만 이번 결과는 단일 단체의 테스트에 기반하며, OpenAI는 방법론상 한계를 들어 결론을 인정하지 않았다. 테스트 시점과 보호 기능 활성화 시점의 불일치 가능성, 참여 유도 문구 판정의 주관성 등은 양측이 여전히 다투는 지점이다.