AI 자기개선 시점을 두고 현장 연구자 3인이 엇갈린 진단을 내놨다.

Hacker News29일 전조회 2

프런티어 AI 연구자 세 명이 한 팟캐스트에 모여 '재귀적 자기개선(recursive self-improvement, RSI)'이 현실이 되는 시점을 두고 서로 다른 전망을 내놨다. 출연자는 John Schulman(Thinking Machines 최고과학자이자 OpenAI 공동창업자로, ChatGPT로 이어진 RLHF 작업을 이끌었다), Beren Millidge(Zyphra CTO), Charlie O'Neill(Baseten 모델 학습 총괄)이다. 진행을 맡은 Dwarkesh Patel은 '2036년에 초지능이 등장하지 않았다면 그 기술적 이유는 무엇이겠느냐'는 질문으로 대담을 열었다.

가장 자주 언급된 병목은 시뮬레이션과 현실 사이의 격차다. 벤치마크나 학습 환경에서 뛰어난 성능을 내는 모델이 실제 업무에서는 같은 수준의 판단력을 보여주지 못한다는 문제다. 여기에 메타러닝의 일반화와 지속학습(continual learning)이 끝내 풀리지 않을 경우, AI는 사람이 정의한 과제에서는 압도적이지만 스스로 새로운 과제를 정의하지는 못하는 상태에 머물 수 있다는 시나리오가 제시됐다.

새 모델이 나올 때마다 '이번이 AGI'라는 평가가 나오고, 한 달쯤 쓰다 보면 다시 부족해 보이는 사이클이 반복된다는 지적도 나왔다. 모델이 사람보다 훨씬 많은 코드를 작성하더라도 연구·엔지니어링 전체의 생산성이 100배로 뛰지는 않는다는 것이다. 병목이 사라지지 않는 한 이런 순환이 예상보다 여러 번 이어질 수 있다는 관측이다.

반대편 논리도 만만치 않다. '칩 위에 올릴 수 있는 학습자'의 전역 최적점과 현재의 트랜스포머+RL 레시피 사이 거리가 핵심 변수라는 관점이다. 인간 연구자보다 0.1%만 뛰어난 에이전트라도 수십만에서 수백만 개를 병렬로 돌리고 칩 속도까지 빨라지면 다른 모든 병목을 압도하며 빠른 테이크오프로 이어질 수 있다는 것이다.

무어의 법칙 비유도 등장했다. 오랫동안 직선처럼 보였던 성능 곡선 뒤에는 계속된 불연속적 혁신이 있었다. LLM도 사전학습 스케일링 법칙이 한계에 부딪힌 뒤 RL이 등장해 새 곡선을 만들었다. 문제는 다음 불연속을 현재의 RL 환경 학습 방식이 스스로 찾아낼 수 있느냐다. 그렇지 못하면 점근선에 머물 수 있다는 우려가 제기됐다.

대담은 RSI 반론을 공정하게 검토하는 것에서 시작해 중국 연구소들의 진전 요인, 자동화된 AI 연구자를 어떻게 학습시킬지, 장기 호라이즌 강화학습이 AGI로 이어질지, 데이터가 설명하는 진전의 비중, RL이 잘 작동하는 이유, 알파고의 'Move 37'과 엔트로피 붕괴, 그리고 각자의 타임라인 전망으로 이어졌다.

개발자 입장에서 이 논쟁의 실질적 함의는 병목의 위치다. 코드 생성 자체보다 생성된 코드를 검증하고 판단하는 일이 생산성을 좌우한다는 진단은, 에이전트가 만든 소프트웨어를 어떻게 신뢰할지가 당면 과제라는 뜻이다. 평가 환경과 RL 환경을 얼마나 잘 설계하느냐가 모델 성능의 다음 구간을 가르는 변수가 될 수 있다는 시사점도 나온다.

다만 이 대담은 확정된 예측이 아니라 연구자들의 가설과 전망을 나눈 자리다. 특정 시점이나 기술적 돌파구를 단정하지 않았고, RSI 도달 여부는 여전히 열린 문제로 남아 있다.

관련 글