Station이 열린 과학 연구에서 AI 에이전트의 자율 발견을 실증한다

Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station

HF Daily2610.08927

Wenyu Du, Stephen Chung2026-10-06

무엇인가

이 논문은 명확한 평가 지표가 없는 열린 연구 과제에서 AI 에이전트가 스스로 과학적 발견을 할 수 있는지를 묻는다. 기존 AI 과학 발견 시스템들은 정답이나 성능 지표가 분명한 문제, 혹은 미리 정해진 연구 파이프라인에서 성과를 냈다. 반면 신경망 해석이나 물리 현상 이해처럼 무엇이 좋은 결과인지 객관적으로 판정하기 어려운 과제에서는 진행 상황을 스스로 판단해야 한다. 저자들은 여기서 두 가지 문제를 지적한다. 첫째는 판단 불일치로, 에이전트의 주관적 판단이 해당 분야 인간 연구자의 판단과 어긋날 수 있다. 둘째는 가로등 효과로, 과학적 가치가 낮아도 검증하기 쉬운 질문으로 방향이 흘러가기 쉽다.

어떻게 동작하나

저자들은 다중 에이전트 연구 환경인 Station을 열린 과제용으로 확장한다. Station은 서로 다른 모델과 컨텍스트를 가진 에이전트들이 중앙 컨트롤러 없이 각자 연구 방향을 제안하고 실험하며, 내부 문헌 시스템에 논문을 올리고 서로의 결과 위에 쌓아 올리는 분산형 과학 생태계 시뮬레이터다. 이산 시간 단위인 틱마다 보통 6개의 활성 에이전트가 관측을 받고 응답을 생성한다. 여기에 세 가지 장치를 더한다. Supervisor는 전용 에이전트로, 실험이나 논문 제출 권한 없이 다른 에이전트에게 가벼운 지침만 주고, 각 에이전트가 제출한 연구 제안서의 방향을 정해진 틱 수만큼 유지하도록 강제한다. 방향 전환은 필수 패키지를 쓸 수 없는 경우 같은 예외에만 허용된다. Meta Reflection은 50틱마다 에이전트를 멈춰 세우고, 인간 연구자의 관점에서 자신의 연구 참신성과 중요성, 지속과 조기 전환의 균형을 재평가하게 하는 자기 점검 프롬프트를 던진다. 이때 응답은 에이전트 자체 모델과 무관하게 GPT-5.5가 생성해 독립적 재평가를 유도한다. 마지막으로 Consolidation Agent가 Codex와 GPT-5.5로 실행되어 결과를 약 8,000단어 연구 보고서로 통합한다.

무엇과 다른가

실험은 두 부류의 과제로 구성된다. 재발견 과제 3개는 ICLR 2025 구두 발표 논문(Bush 등, RL 에이전트의 창발적 계획)과 ICLR 2026 구두 발표 논문(Golowich 등, LLM 출력의 저차원 구조 / Sharma 등, RNN의 시간 표현)에서 연구 질문과 실험 환경만 가져오고 결과는 숨긴다. 탐색 과제 2개는 정답 논문 없이 LLM의 잠재 학습(subliminal learning)과 VLM 환각을 다룬다. 재발견 과제마다 시드만 바꿔 3회, 탐색 과제는 1회 실행하며, 각 실행은 Gemini 3.1 Pro 3개, GPT-5.5 1개, Claude Opus 4.8 2개로 구성된 6개 에이전트가 300틱 동안 웹 접근 없이 인간 개입 없이 진행된다. 평가는 실행 전에 원본 논문의 주요 발견을 약 10개의 하위 발견으로 쪼개 두고, 보고서가 실질적으로 유사한 발견과 근거를 제시할 때만 재발견으로 인정한다. 실행마다 Consolidation Agent를 3번 돌려 보고서 3개를 만들고, 각 보고서를 GPT-5.5가 3개 시드로 자동 채점해 총 9개 점수의 평균을 낸다. 블라인드 전문가 평가와 자동 평가의 일치도가 높았다고 저자들은 밝힌다.

어떻게 쓰나

재발견 성적에서 Station은 평균 62.7%를 기록했다. Codex Multiagent-v2는 15.4%, AI Scientist-v2는 14.4~20.6%였다. 과제별로는 RL 에이전트 창발 계획에서 11개 중 8.33개(75.8%)로 Codex(6.1%)와 AI Scientist-v2(6.1~19.2%)를 크게 앞섰고, LLM 출력 저차원 구조에서 12개 중 8.44개(70.4%)로 Codex(33.3%), AI Scientist-v2(32.4~37.0%)를 앞섰다. RNN 시간 표현 과제는 10개 중 4.19개(41.9%)로 상대적으로 낮았지만 Codex(6.7%), AI Scientist-v2(0.0~11.1%)보다는 높았다. 회복의 성격에도 패턴이 있다. 첫 과제에서는 탐침(probing) 발견은 잘 회복했지만 인과 개입 실험이나 더 깊은 기계론적 설명은 회복하지 못했고, 두 번째 과제에서는 시퀀스 수준 구조와 재사용 관계는 거의 완전히 회복했으나 함수적 함의는 제한적이었다. 세 번째 과제에서는 학습된 모델이 주어지지 않아 에이전트가 직접 RNN을 학습해야 했는데, 용량 제약 하의 메모리 성능 최적화에 몰리면서 비선형 모델이 오래된 정보를 급격히 억제하는 메커니즘 설명은 거의 건지지 못했다.

전제와 한계

두 장치의 효과를 보기 위한 절제 실험에서 두 장치를 모두 제거하면 창발 계획 과제의 재발견율이 75.8%에서 57.9%로 떨어졌고, 특히 앞선 개념 탐침 결과 위에 쌓아 올려야 하는 개입 발견에서 낙폭이 컸다. 연구 프로젝트의 평균 지속 기간도 67.0틱에서 55.5틱으로 줄었다. Meta Reflection은 92회 발생 중 71.7%가 기존 방향을 심화하거나 검증하는 실험으로 이어졌다. 저자들은 한 사례를 든다. 어떤 에이전트가 정적 벽과 복도에 대한 공간 정보 갱신 프레임워크를 만들었는데 계획 연구와의 연결성이 약했고, Meta Reflection이 이를 지적하자 같은 프레임워크를 움직이는 상자에 적용해 계획이라는 중심 질문으로 방향을 되돌렸다는 것이다.

정답 논문이 없는 탐색 과제에서도 성과가 나왔다. 잠재 학습 과제에서 에이전트들은 특성 전이가 LoRA 랭크에 대해 역U자 관계를 보인다는 것을 발견했는데, 이는 동시기 인간 연구자 논문(Nief 등)과 일치한다. 특이값 분해로 초기 레이어 LoRA 업데이트의 상위 특이 모드 몇 개만 남겨도 전이된 특성 대부분이 보존된다는 점도 확인했고, 랭크 128에서 실패한 전이는 초기 레이어에만 LoRA 어댑터를 학습시키면 복구된다는 결과까지 얻었다. 저자들은 이 마지막 결과가 Nief 등의 국소화 발견을 넘어선 새로운 발견이라고 주장한다. VLM 환각 과제에서는 프롬프트 프리필 단계에서 마지막 두 레이어의 MLP 출력을 0.5배로 줄이면 내용 기반 환각이 줄어든다는 단순한 개입을 찾아냈고, 이는 Guo 등의 동시기 연구와 원리와 설명이 모두 맞닿아 있다.

개발자 관점에서 이 논문의 실용적 메시지는 모델 성능보다 환경 설계가 자율 연구의 병목이라는 점이다. 같은 모델 조합을 쓰더라도 중앙 컨트롤러로 파이프라인을 짜는 방식(AI Scientist-v2, Codex Multiagent-v2)과 분산형으로 각자 방향을 제안하게 하는 방식의 재발견율 차이가 3~4배 벌어졌다. 에이전트에게 장기 과제를 맡기는 시스템을 만든다면, 방향 전환을 제한하는 커밋먼트 장치와 주기적 자기 재평가 루프를 먼저 붙이는 것이 비용 대비 효과가 크다는 시사점을 얻을 수 있다. 다만 이 수치는 ICLR 구두 발표 논문 3편에서 나온 것이고, 평가 자체가 GPT-5.5 자동 채점이라는 점을 감안해 읽어야 한다.

저자들이 명시한 한계는 분명하다. 판단 불일치와 가로등 효과는 완화됐을 뿐 해결되지 않았다. 창발 계획 논문 저자 중 한 명에게 에이전트 연구 제안 24개를 평가하게 했더니 75%가 5점 만점에 1~2점을 받았고, 중심 질문에 대한 통찰을 거의 주지 않는 사소한 세부에 집중한다는 평을 받았다. 에이전트는 앞선 발견 위에 쌓아 올려 더 깊은 설명을 만드는 데 어려움을 겪고, 명확한 성능 지표가 있는 더 쉬운 방향으로 쏠린다. 또한 개별 구성 요소의 기여도는 열린 질문으로 남겨 두었다고 밝히며, 인간의 가벼운 개입이 격차를 줄일 수는 있지만 그것에 의존하면 자율 연구의 확장성이 제한된다고 지적한다.