중국 AI 기업들, 오염된 학습 데이터에 사전학습 재작업
중국 대형 AI 모델 기업들이 최근 반년 사이 사전학습(pretraining)을 처음부터 다시 하는 사례가 잇따르고 있다. 원인은 대부분 같다. 학습에 투입한 데이터의 품질이다. 연산 자원이나 모델 구조, 인재 확보보다 훨씬 눈에 덜 띄던 문제가 실제 성능을 갉아먹으면서, 데이터 거버넌스를 뒤늦게 손보는 흐름이 업계 전반으로 번지고 있다.
구체적인 사례가 나온다. 한 기업은 1년 가까이 조 단위 파라미터 모델을 학습시켰지만, 실제 적용 성능은 시장에 나온 1% 규모의 소형 모델에 역전당했다. 원인을 추적한 끝에 드러난 것은 오염된 학습 데이터였다. 다른 기업은 라벨링 규칙이 모호하고 평가셋이 오염됐으며 중복된 저품질 말뭉치가 쌓여 학습 진척이 더뎠다. 데이터 확보 자체가 막혀 성능 정체를 겪다가 아예 데이터 팀을 새로 꾸리고 처음부터 다시 시작한 곳도 있다.
가장 자주 언급되는 실패 유형은 크롤링 데이터다. 한 기업은 기술 블로그를 통째로 긁어 사전학습 말뭉치에 넣었다가 학습 중반에 문제를 발견했다. 상당수가 수집 사이트가 기계로 생성한 페이지였고, 같은 문단이 수만 번 반복돼 있었다. 모델이 평가셋에서 이유 없이 같은 문장을 되풀이하기 시작했고, 팀이 원인을 특정했을 때는 이미 수만 GPU-시간이 소진된 뒤였다. 해당 버전은 폐기됐다. 한 데이터 전문가는 초기에는 '데이터가 많으면 되고 조금 나빠도 모델이 알아서 견딘다'는 인식이 우세했지만, 결국 60~70점에서 멈춘 모델을 90점까지 끌어올리지 못해 되돌아올 수밖에 없었다고 말한다.
배경에는 데이터 확보 경로에 대한 인식 변화가 있다. 인터넷 시대에 각 대기업이 '해자'로 여겼던 로컬 생활, 소셜, 게임, 이커머스, 검색 같은 시나리오 데이터는 AI 시대에 효력이 크지 않다는 평가가 나온다. 파운데이션 모델은 범용 능력을 겨루기 때문에 특정 영역 데이터의 우위가 범용 성능으로 이어지기 어렵다는 것이다. 시나리오 데이터가 가장 많은 구글이 가장 잘하고 있지도 않으며, 데이터 축적이 거의 없던 Anthropic이나 OpenAI가 더 빠르게 치고 나갔다는 지적도 나온다. 대신 격차를 만드는 것은 GPU 확보, 데이터를 얼마나 빨리 가져오는지, 품질이 얼마나 높은지, 그리고 데이터를 안정적으로 모델 능력으로 바꾸는 파이프라인이 있는지다.
데이터 작업의 성격도 드러난다. 한 데이터 전문가는 특별한 비법은 많지 않고, 60점짜리 데이터를 90점까지 끌어올리는 꾸준한 노동에 가깝다고 말한다. 모든 데이터를 검수할 수는 없고 학습 주기도 있으니, 중요한 것부터 단계적으로 처리하며 조금씩 개선하는 방식이 불가피하다는 것이다. 문제는 여기에 들어가는 돈과 인력이다. 한 데이터 공급업체 관계자는 AI 학습에 100을 쓴다면 연산에 40, 인재에 30, 광고에 20, 데이터에 10 정도가 배분된다는 개략적인 구분을 전했다. 전문가 장기 과제 데이터의 경우 미국 HLE 조사는 건당 1만~2만 달러에서 시작하지만, 중국에서는 보통 1000~2000위안 수준이 제시된다는 것이다.
확보 경로도 다양해지고 있다. 일부 모델 기업은 API 중계 서비스를 운영하며 토큰을 전달하는데, 수익 외에도 대량의 사용자 행동 데이터를 모을 수 있다는 점이 더 중요하다는 설명이다. 사용자가 여러 모델을 호출할 때 요청과 결과가 이 중계 계층을 거치면서 실제 과제 데이터가 플랫폼에 남는다. 모델 라우팅을 하는 스타트업들도 같은 자산을 노리고 있다. 모델이 강해질수록 사용자가 어려운 과제를 맡기고, 그 과정에서 고품질 데이터가 되돌아와 모델을 다시 강하게 만든다는 이른바 '데이터 플라이휠' 논리도 자주 언급되지만, 아직 이를 실제로 돌린 곳은 많지 않다는 평가다.
개발자 입장에서 눈에 띄는 변화는 인력 수요다. 데이터 정제, 데이터 파이프라인 구축, 데이터 엔지니어링, 데이터 연구 직군에 대한 수요가 최근 들어 본격적으로 커지고 있다는 것이 헤드헌터들의 전언이다. 과거에는 보조 직군으로 분류되던 자리다. 장기 궤적 데이터는 주로 AI 코딩과 AI 오피스 영역에서 나오는데, AI 코딩 시장의 상당 부분은 Claude와 Codex가 가져갔고 AI 오피스 제품은 아직 초기 단계라 축적된 데이터가 얇다. 사전학습 재작업은 첫 번째 충격에 불과하다는 관측이 나온다.
다만 이 기사에 인용된 사례와 수치는 대부분 익명 또는 가명으로 처리된 업계 관계자들의 전언이며, 특정 기업이 공식적으로 확인한 내용이 아니다. 업계에서는 향후 1~2년 안에 유사한 재작업 사례가 더 나올 가능성이 크다고 보지만, 데이터 인프라 구축이 어느 정도 마무리되기 전까지는 실제 격차가 어디서 벌어지는지 판단하기 어렵다는 시각도 함께 나온다.