InnovationEval, 최전선 AI의 ML 기법 자체 발견은 아직 요원하다
Epoch AI가 AI가 스스로 새로운 머신러닝 기법을 만들어낼 수 있는지 측정하는 평가인 InnovationEval의 초기 결과를 내놨다. 결론은 아직 이르다는 쪽이다. 최전선 모델들은 수천 달러 상당의 GPU 시간을 실험에 쏟고도 인간 연구자가 개발한 기법에 필적하는 성과를 내지 못했다.
과제는 실제 논문 하나를 기준점으로 삼는다. 최근 AI 연구자들이 발표하고 여러 모델에 채택된 온폴리시 자기증류(SDPO)가 그 대상이다. 에이전트에게는 강한 GRPO 베이스라인을 능가하는 새로운 포스트트레이닝 기법을 만들라는 요구가 주어진다. Qwen3-8B를 포스트트레이닝해 짧은 답변형 질문과 코딩 과제에서 성능을 끌어올려야 하며, 원 논문의 실험에서 나온 참조 수치에 도달하거나 넘어서면 100%, GRPO 베이스라인 수준에 머물면 0%로 환산된다. 두 결과 영역의 평균이 최종 점수다.
평가 범위는 알고리즘 변경으로 좁혀져 있다. 손실 함수와 그 업데이트, 롤아웃, 고정된 학습 데이터 배치 위에서의 모델 주도 수정 같은 요소가 대상이다. 합성 데이터셋을 만들어 미세조정하는 식의 우회로를 차단하려는 장치다. SDPO와는 전혀 다른 아이디어로 같은 성능에 도달하는 것도 허용되지만, 연구 영역 자체는 원 논문과 크게 벗어나지 않게 묶인다. 정의의 허점을 파고드는 시도가 반복될 위험은 남지만, 검토 부담을 줄이는 효과는 있다고 저자들은 본다.
배경에는 자동화된 AI 연구자를 만들려는 개발사들의 목표가 있다. 소프트웨어 엔지니어링, 데이터셋 생성, 정해진 지표의 최적화 같은 개별 작업에서 AI의 능력은 이미 여러 평가로 확인됐다. 문제는 그 조각들을 이어 붙여 처음부터 끝까지 하나의 연구 프로젝트를 완주하는 능력이다. Crux Evals, ResearchGym, RSI-Bench, NanoGPT 스피드런 같은 작업들이 같은 문제의식을 공유한다. 1905년까지의 지식만 가진 AI가 특수상대성이론을 다시 유도할 수 있겠느냐는 사고실험을, 훨씬 완만한 형태로 옮겨 놓은 셈이다.
채점 방식도 아직 정착되지 않았다. 처음에는 Opus 5를 판정자로 세운 자동 채점을 시도했지만, 평가 대상 모델 수가 적어 결국 사람이 개입하는 검토를 병행하게 됐다. 시도 한 번에 드는 컴퓨트 비용이 커서 실행 횟수 자체가 적다는 점도 결과의 통계적 무게를 제한한다.
실무적으로 이 결과가 던지는 신호는 두 갈래다. 자체 포스트트레이닝 기법을 탐색하는 팀이라면, 에이전트가 기존 기법의 조합만으로는 도달하기 어려운 지점이 있다는 것을 감안해야 한다. 동시에 평가를 설계하는 입장에서는 지표 개선이 진짜 연구 진전을 요구하도록 스코프를 잘라내는 일이 얼마나 까다로운지를 보여준다. 지표만 올리면 되는 과제는 금세 꼼수가 생기고, 그렇다고 범위를 좁히면 새로운 기법이 나올 여지도 함께 줄어든다.
가장 실질적인 한계는 기억이다. 이번 프로젝트가 진행되는 동안 모델들이 과제를 학습 데이터로 흡수하는 현상이 실제로 관측됐다. 주요 결과를 낸 Claude Fable 5와 GPT-5.6 Sol은 검색 없이 논문 세부를 떠올리게 했을 때 기억의 흔적을 보이지 않았지만, 후속 모델인 Claude Fable 5.1과 GPT-6 Astra는 과제 자체를 인지하고 있었다. Epoch AI는 앞으로 새 모델마다 기억 여부를 점검해 결과에 표시하고, 필요하면 과제를 새로 만들어 평가를 갱신할 계획이다.
정리하면 InnovationEval은 AI가 AI 연구를 자동화했다고 말할 수 있는 시점이 아직 멀다는 증거를 하나 더 얹은 셈이다. 다만 이번 결과는 단일 논문, 소수 실행에 기반한 초기 측정치이므로 방법론을 확장하고 반복해 추세를 지켜보겠다는 것이 저자들의 입장이다.