인간이 정한 문제를 넘어 발견 과정 자체를 학습·실행·평가하는 Discovery Foundation Models

Discovery Foundation Models: Toward Open-Ended Discovery Intelligence

HF Daily2609.15973

Ling Yang, Zhenfei Yin, Yingcheng Wu2026-09-14조회 4

무엇인가

이 논문은 파운데이션 모델이 지식 학습과 추론, 도구 사용, 행동 결과 피드백으로 확장되어 왔지만 대부분은 인간이 이미 정한 연구 구조 안에서 최적화한다고 진단한다. 문제, 변수, 목표, 도구, 평가자가 주어지면 모델은 그 안에서 탐색하고 최적화할 수 있지만, 고정된 표상은 빠진 변수를 표현하지 못하고, 평가자가 무시하는 속성을 회복하지 못하며, 관측이 식별 불가능하면 샘플을 늘려도 메커니즘을 구분하지 못한다. 그래서 자동화된 워크플로가 잘못된 프레이밍을 더 효율적으로 수행할 수 있다. 논문은 이 한계를 넘어 Discovery Intelligence를 정의하고, Discovery Foundation Models를 열린 발견을 위한 범용 모델 시스템 범주로 제안한다. DFM은 가치 있는 미지를 식별하고, 연구 가능한 문제를 공식화하며, 표상을 구성·수정하고, 검증 가능한 설명을 만들고, 정보성 있는 개입을 설계하며, 외부 증거로 연구 상태를 갱신하고, 작업과 도메인을 넘어 발견 능력을 계속 개선해야 한다. 과학은 질문이 불충분하게 명세되고, 변수가 숨겨져 있고, 메커니즘이 관측적으로 동등하며, 개입이 비싸고, 평가자가 불완전하고, 결과가 지연되는 환경이므로 이런 능력을 형성하는 장으로 쓰인다.

어떻게 동작하나

논문은 전통적 과제를 Q=(P,R,G,T,V), 즉 문제, 표상, 목표, 도구, 평가자로 추상화한다. 발견은 이와 달리 부분적으로 이해된 세계 W, 초기 지식 상태 K0, 계산·실험·안전·접근 제약 B에서 출발해 Φ_disc: (W,K0,B) -> (ΔK, Ξ)를 만든다. ΔK는 외부에서 검증된 진전이고, Ξ는 상태 전이, 대안, 개입, 관측, 실패한 공식화, 수정의 기록이다. 전통 과제와 달리 발견 에피소드에서는 문제, 표상, 가설 공간, 개입 전략, 검증 절차 자체가 바뀔 수 있다. DFM의 능력은 C_DFM = {C_find, C_form, C_repr, C_hyp, C_int, C_rev, C_cont}로 정리된다. C_find는 연구 자원을 배분할 가치가 있는 미지 구조를 고르고, 보정·검색·더 강한 베이스라인에서 사라지는 겉보기 미지을 걸러낸다. C_form은 선택된 미지를 객체, 범위, 규모, 조건, 관측 가능량으로 묶어 경계 지어진 검증 가능 문제로 만든다. C_repr은 변수, 관계, 추상화, 스케일을 구성하며, 현재 표상이 모든 후보 설명을 동등하게 만들거나 같은 실패 경계를 반복할 때 결정적이 된다. C_hyp은 명시적 가정, 유효 범위, 예측, 반증 가능 조건을 가진 기계적으로 구별되는 설명을 만든다. C_int는 확인만을 위한 실험이 아니라 연구 상태에 미칠 기대 효과를 기준으로 실험, 시뮬레이션, 코드 실행, 절제, 반례, 대체 측정, 복제를 고른다. C_rev는 예상 밖 결과의 원인을 귀속하고 가설, 표상, 문제 공식화, 프로토콜, 측정 과정, 개입 계획 중 적절한 객체를 갱신한다. C_cont는 검증된 에피소드 간 경험을 Discovery Skill로 바꿔 미래 발견 행동을 바꾼다. 앞의 여섯 능력은 한 조사 안에서 작동하고, 일곱 번째는 작업 간 업데이트 기제다.

무엇과 다른가

발견 과정은 고정된 단계 파이프라인이 아니다. 여러 공식화가 공존할 수 있고, 서로 다른 표상이 서로 다른 가설군을 지지하며, 증거가 조사를 이전 객체로 되돌릴 수 있다. 문제는 P=(O,Ω,ℓ,C,Y,Q), 즉 연구 객체, 범위, 관련 스케일, 조건, 관측 가능량, 미해결 관계나 메커니즘으로 표현된다. 표상은 R=(O,V,R,A,L), 즉 객체, 변수, 관계, 추상화나 거친 입자화, 구조적 제약으로 구성된다. 가설은 H_i=(μ_i,A_i,D_i,Ŷ_i,F_i), 즉 메커니즘, 가정, 유효 범위, 예측, 약화 또는 반증할 관측으로 표현된다. 개입은 연구 상태에 만들 것으로 기대되는 변화를 기준으로 선택되고, 증거 기반 수정은 모순이 이론 실패인지 측정 오류인지 프로토콜 이탈인지 숨은 교란인지 시뮬레이터 오명세인지 환경 변화인지 귀속한다. Zetema는 이 틀을 명시적 연구 상태, 분기와 롤백, 검증과 Research World Model을 통한 행동 게이팅, 외부 grounding, 작업 간 Discovery Skill 진화로 구현한다. 시스템 경계는 D=(πθ,S,M,T,E,V,H), 즉 파운데이션 모델 정책, 연구 상태, 영속 메모리, 외부 도구, 결과를 돌려주는 환경, 검증 기제, 인간 연구자나 감독으로 정의된다. 검증은 하나의 스칼라 보상으로 환원되지 않으며, 어떤 검증자가 어떤 상태 전이를 지지했는지 보존하고 증거가 주장 승격을 정당화하지 못하면 보류하거나 에스컬레이션해야 한다. 자율성은 능력과 직교한다. 위험 낮은 코드는 자동 실행하되 물리 실험은 승인을 요구해도 같은 발견 연산자를 구현할 수 있다. 훈련은 연구 프로그램을 바꾸는 중간 결정을 대상으로 하고, 궤적, 상호작용 환경, 과정 감독, 과학적 피드백, 자원 배분을 사용한다. 평가는 현재 에피소드의 외부 검증 진전과, 자원과 검색 통제를 맞춘 조건에서 미래 발견 행동의 전이 가능한 개선을 함께 측정한다.

어떻게 쓰나

이 논문은 정량 벤치마크 논문이 아니다. 제공된 원문에는 데이터셋, 베이스라인, 정량 개선폭, 표의 숫자가 제시되지 않았다. 대신 GALILEO가 물리적 발견 루프의 실증적 grounding으로 제시된다. GALILEO는 실제 치료제 발견 시스템으로, multi-omics 기반 표적 선정과 펩타이드 설계, 로봇 합성, 멀티모달 표현형 분석, 독립적인 수작업 분석, 반복적 증거 기반 수정을 결합한다. 실험적으로 검증된 LRRC8C와 SLC25A1 분기에서 물리 측정은 이후의 표적 신념, 분석 선택, 메커니즘 가설, 분자 설계 정책을 바꾸었다. 다섯 번의 최적화 라운드에서 이 피드백은 전이 가능한 Amphiphilic Balance Grammar로 통합되었다. 저자들은 이를 개입-증거-수정 루프의 경험적 근거로 사용하되, 일반 목적 DFM 주장과 단일 도메인 특화 시스템을 구분한다. 따라서 이 원문만으로는 정량적 성능 비교나 재현 가능한 수치를 확인할 수 없다.

전제와 한계

개발자에게 이 논문은 과학 AI 에이전트나 자동화 실험 시스템을 만들 때 최종 답 정확도만 최적화하는 구조가 왜 구조적 한계를 갖는지 보여준다. 시스템 경계를 모델 하나가 아니라 정책, 연구 상태, 메모리, 도구, 환경, 검증기, 인간 참여자의 묶음으로 설계해야 한다. 연구 상태는 명시적이고 버전 가능하며 롤백 가능해야 하고, 검증 게이트와 실험 승인, 실패 원인 귀속이 필요하다. Discovery Skill은 단순히 성공 궤적을 저장하는 것이 아니라 언제 적용되고 무엇을 바꾸며 어떤 후속 증거가 이득을 보여주는지까지 검증된 경험만 승격해야 한다. 평가는 최종 답이 아니라 과정 중심이어야 하며, 자원과 검색 통제를 맞춘 비교가 필요하다. 물리 실험과 연결할 때는 provenance, 캘리브레이션, 샘플 이력, 시약 변동, 오염, 드리프트, 프로토콜 이탈을 기록해야 한다. 권한은 전역 자율성 점수가 아니라 행동과 환경에 붙여야 하고, 재귀적 자기수정에서는 감사 기록, 롤백, 권한 경계, 독립 평가 채널을 일반 수정에서 분리해야 한다. 실무적으로는 어떤 부분이 인간이 고정한 입력인지, 모델이 수정 가능한 연구 객체가 무엇인지, 외부 검증자가 누구인지, 실패 시 어떤 객체를 업데이트하는지를 먼저 확인해야 한다.

저자들이 밝힌 전제와 한계도 분명하다. 이 프레임워크는 일반 자율 과학 발견이 이미 해결되었다고 가정하지 않고, 하나의 아키텍처가 모든 컴포넌트를 구현해야 한다고 보지도 않는다. DFM이라는 라벨이 입증되지 않은 능력을 제공하지도 않는다. 물리적 발견은 provenance, 실행 노이즈, 희소성, 비가역성, 제도적 제약을 추가한다. 실패한 실험은 이론, 조작, 기기, 재료, 분석 중 어디가 문제인지 불분명할 수 있고, 이론적으로 식별 가능한 개입도 사용 가능한 해상도나 샘플 크기 때문에 불가능할 수 있다. 물리 과학에서는 정확한 재현이 항상 가능하지 않고, 민감하거나 독점적인 데이터는 제한 접근이 필요할 수 있다. 독립 검증은 이분법이 아니며, 데이터, 모델 패밀리, 기관, 기기, 프로토콜, 분석 축이 실제로 다른지 명시해야 한다. 증거 요구 수준은 주장이 통제하는 자원과 영향력에 비례해야 한다. 재귀 업데이트는 잘못된 스킬, 평가자 드리프트, 오명세된 시뮬레이터, 메모리 정책 변화로 미래 증거를 왜곡할 수 있고, 작은 왜곡이 여러 에피소드에 걸쳐 복리로 쌓일 수 있다. 측정 성능은 좋아지는데 실제 발견 능력은 좁아지는 역설이 가능하므로, 버전 관리, 샌드박싱, 단계적 배포, 카나리 과제, 섀도 모드, 홀드아웃 환경, 충돌 탐지, 롤백, 속도 제한, 외부 감사가 필요하다.

결국 이 논문의 핵심 주장은 발견을 학습 가능하고 실행 가능하며 평가 가능한 파운데이션 모델 시스템의 능력으로 만들자는 것이다. 디지털, 시뮬레이션 기반, 물리적, 재귀적 시스템이 같은 발견 연산자를 인스턴스화할 수 있지만, 각 영역에서 grounding, validation, responsibility의 부담은 달라진다. 개발자에게는 AI scientist를 문제를 푸는 모델이 아니라 연구 상태를 수정하는 시스템으로 바라보고, 문제 설정과 표상, 개입, 수정, 전이를 관측 가능한 결정으로 설계해야 한다는 원칙을 준다. 원문에 정량 결과가 없어 성능 비교는 할 수 없지만, 시스템 경계와 과정 중심 평가, 거버넌스 요구사항은 과학 AI 에이전트를 설계할 때 참고할 만한 체크리스트를 제공한다.