필즈상 수상자 25인, "AI의 수학 문제 풀이 경쟁은 수학을 망친다" 공동 선언
테렌스 타오를 비롯한 필즈상 수상자 25명이 AI 기업들의 수학 문제 풀이 경쟁이 수학 연구 자체를 해친다는 내용의 공동 선언을 발표했다. 2026년 9월 11일 타오의 블로그를 통해 공개된 이 선언은, 최근 몇 달 사이 LLM의 수학적 능력이 급격히 향상되면서 여러 분야의 주요 미해결 문제를 풀어내기 시작한 상황을 배경으로 한다.
선언문에는 아르투르 아빌라, 만줄 바르가바, 피에르 들리뉴, 사이먼 도널드슨, 마르틴 하이러, 허준이, 막심 콘체비치, 제임스 메이너드, 피터 숄체, 세드리크 빌라니 등 1978년부터 2026년까지의 필즈상 수상자들이 이름을 올렸다. 서명자들은 지난 일주일간의 논의를 거쳐 선언문을 작성했고, 별도 웹페이지에 게시해 추가 서명을 받고 있다. 경제 전문지 기사와 제임스 메이너드 인터뷰가 함께 공개됐으며, 프랑스어판은 르몽드에 실렸다.
선언의 핵심 논지는 목표의 불일치다. AI 기업은 수학 문제 해결을 성능 지표로 삼아 밀어붙이지만, 수학 공동체의 목적은 개념적 이해와 통찰 그 자체에 있다는 것이다. 문제를 푸는 행위는 그 목적에 이르는 도구이자 대리 지표일 뿐인데, 이것이 목적 자체로 착각되면 도구가 본래 목적을 거스르게 된다는 경고다.
서명자들은 참/거짓 진술이 점점 빠른 속도로 대량 생산되면 새로운 아이디어가 자랄 토양이 오히려 파괴될 수 있다고 본다. 수학에서 하나의 결과가 정착하려면 강연과 토론, 단순화 과정을 거쳐 대학원생이나 학부생도 읽을 수 있는 교과서적 형태로 다듬어져야 하는데, AI가 내놓은 해법은 이런 숙성 과정 없이 급하게 발표되는 경우가 많다는 지적이다.
여기서 파생되는 문제로 귀속과 표절 논란도 제기된다. 새 방법과 아이디어를 분리해 정리하고 선행 연구를 인용할 시간이 확보되지 않으면, 창작 직군 전반에서 익숙한 저자 표기 문제가 수학에서도 반복될 수 있다는 것이다. 또한 AI가 만들어낸 아이디어를 수학의 정전에 통합하고 발전시키는 일은 결국 사람 수학자가 맡아야 하므로, 세대를 잇는 전승 사슬이 끊길 위험도 함께 언급된다.
선언은 이 문제를 수학만의 사안으로 한정하지 않는다. 오랜 훈련이 최종 답이나 산출물을 만드는 동시에 이해를 쌓고 새로운 질문을 던지는 능력을 기르는 과정이었다면, 방대한 인간 선행 작업 위에 세워진 AI가 그 결과물을 곧바로 뽑아내는 순간 목적과 수단이 어긋난다는 진단이다. 과학과 창작 전반, 나아가 사회 전체가 같은 형태의 문제를 마주할 것이라는 전망이 담겼다.
개발자 입장에서 이 선언은 벤치마크 설계에 대한 경고로 읽힌다. 어떤 지표를 최적화 대상으로 삼는 순간 그 지표가 해당 분야의 실제 목표를 밀어내는 현상은 수학에 국한되지 않는다. 코드 생성, 문서 작성, 리뷰 자동화 등에서도 AI가 만들어낸 결과물을 검증하고 기존 작업에 연결하는 파이프라인이 없다면, 처리량은 늘어나도 축적되는 이해는 줄어들 수 있다.
다만 선언은 AI 자체를 부정하지 않는다. 서명자들은 AI가 진정한 수학 연구와 이해를 강화하고 가속할 잠재력이 있다고 명시한다. 다만 그 변화가 분야에 이익이 될지 파괴적일지는 이 기술을 통제하는 사람들의 결정에 크게 좌우된다는 것이 이들의 입장이다. 수학 공동체와 기술 기업, 그리고 사회가 이 문제를 시급히 다뤄야 한다는 요청으로 선언은 끝맺는다.
관련 글
- OpenAI, 수학 자문 그룹 출범…내부 모델이 미해결 문제 100개 이상 풀었다고 주장OpenAI가 고등연구원(IAS)에 수학·AI 자문 그룹을 출범시켰다. 나비에-스토크스 밀레니엄 문제 해법 공개 이후 내부 모델이 미해결 문제 100개 이상을 풀었다는 주장과 함께 나온 조치다.
- a16z가 투자한 Vals, '문항 비공개' 산업별 평가로 AI 벤치마크 판을 뒤집으려 한다AI 벤치마킹 스타트업 Vals가 앤드리슨 호로위츠가 이끄는 시리즈 A에서 4천만 달러를 유치했다. 시험 문항을 공개하지 않고 법률·금융·코딩 등 산업별 실무 과제로 모델을 평가해 기존 벤치마크의 한계를 겨냥한다.
- 단일 프롬프트를 여러 모델·여러 시점에 돌리는 LLM 벤치마크 'LLM Ass Bench' 공개하나의 프롬프트를 여러 LLM에 적용하고 날짜를 바꿔가며 결과를 기록하는 벤치마크가 해커뉴스에 소개됐다. 모델별 점수 한 줄이 아니라 시간에 따른 변화를 함께 본다는 점이 특징이다.
- 코딩 에이전트 성능, 모델보다 '하네스'가 더 좌우할까코딩 에이전트의 성능 차이에서 모델 자체와 이를 감싸는 실행 골격(하네스)이 각각 얼마나 기여하는지를 따져보는 'HarnessTax' 논의가 개발자 커뮤니티에서 화제다. 같은 모델이라도 하네스에 따라 결과가 갈릴 수 있어 벤치마크 해석과 도구 선택 기준을 다시 보게 만든다.