스스로 분석 도구를 만들고 자기 가설을 반증하는 LLM 에이전트, 자율 실험의 산출물을 최적 샘플에서 '이해'로 바꾸다

Hypothesis-Driven Autonomous Materials Synthesis with Multimodal LLM Agents

arXiv2609.18598v1

Izumi Takahara2026-09-16조회 4

무엇인가

자율 실험실(self-driving laboratory)은 합성 조건을 스스로 탐색하지만, 의사결정 계층은 대개 베이지안 최적화 같은 블랙박스 옵티마이저다. 이런 구조에서는 매 실험에서 나오는 XRD 패턴, 전자현미경 이미지, 스펙트럼 같은 다양한 데이터 중 미리 손으로 정한 한두 개의 스칼라 지표만 최적화에 쓰이고 나머지는 버려진다. 옵티마이저는 왜 그 조건을 제안했는지, 축적된 측정이 공정에 대해 무엇을 밝혔고 무엇이 아직 미지인지 설명하지 못한다. 논문은 이 지점을 문제로 잡는다. 실험 자동화가 지금까지 가속한 것은 가설의 검증뿐이고, 가설의 생성과 정교화는 루프 밖에 남아 있다는 지적이다. 저자들이 내놓는 답은 최적화된 샘플이 아니라, 명시적이고 수정 가능한 '이해'를 캠페인의 1차 산출물로 삼는 것이다.

어떻게 동작하나

SynAgent는 LLM 에이전트가 자동 실험 시스템을 운영하는 멀티에이전트 프레임워크다. OpenAI Agents SDK 위에 구현됐고 모든 에이전트가 GPT-5.5를 쓴다. 캠페인은 설정 파일에 실험 개요, 목표 변수, 조작 가능한 변수와 허용 그리드, 고정 조건을 선언하는 것으로 시작한다. 한 번의 반복은 네 단계로 돈다. 에이전트가 현재 이해를 바탕으로 합성 조건을 제안하고(1), 제안된 조건에서 합성과 측정이 자동 실행되고(2), 획득한 데이터를 스킬, 즉 SynAgent가 스스로 생성한 분석 코드로 분석하고(3), 결과를 성찰해 이해를 갱신한다(4). 이해는 <understanding>이라는 자연어 문서로 유지되며, 합성 조건이 결과를 어떻게 지배하는지에 대한 주장들의 집합이다. 모든 턴은 디스크에 저장된 하나의 지속 세션 안에서 실행되어 캠페인 전체의 대화 맥락이 유지되고, 최근 3회 반복의 SEM 이미지는 비전 입력으로 다시 주입되며 더 오래된 이미지는 그때 에이전트가 직접 기록한 텍스트 형태 기술로 대체된다. 모든 프롬프트와 응답, 제안, 측정값, 스킬 출력, 판정이 반복별로 로그에 남아 각 결정을 추적할 수 있다.

무엇과 다른가

첫 번째 장치는 적응적 스킬 생성이다. 스킬은 메타데이터 문서(SKILL.md)와 분석 모듈(analyze.py) 한 쌍으로, 모듈은 표준화된 MaiML 형식의 측정 파일을 읽어 구조화된 분석 결과를 반환하는 단일 함수를 구현한다. 캠페인 시작 시 스킬 라이브러리는 비어 있고 어떤 분석 파이프라인도 미리 정의되지 않는다. 측정이 도착하면 디스패처가 등록된 스킬들의 메타데이터를 LLM에 제시하고, LLM이 맞는 스킬을 고르거나 새 스킬이 필요하다고 신호한다. 새 스킬은 코드 실행 도구를 가진 전용 생성 에이전트가 만든다. 이 에이전트는 실제 MaiML 파일과 참조 파일을 살펴보고, 정해진 도구 호출 예산 안에서 후보 분석 코드를 반복적으로 작성하고 실행한다. MaiML 파일이 이미지를 참조하면 그 이미지도 비전 입력으로 붙어서, 실제 데이터에 존재하는 특징에 맞춰 분석이 설계된다. 등록 전에 생성된 모듈을 현재 측정에 대해 실행해 자체 테스트를 통과해야 라이브러리에 들어가고, 실패하면 오류와 이전 코드를 되먹여 최대 3회까지 재생성한다. 성찰 단계에서 메인 에이전트는 use_skill 도구로 등록된 스킬을 실행할 수 있고, create_skill 도구로 반복당 최대 하나의 새 스킬을 요청할 수 있다. 최적화 목표를 계산하는 스킬은 캠페인 설정에서 이름으로 고정되며, 첫 측정이 도착할 때 한 번 생성되고 이후 캠페인 내내 정의가 바뀌지 않는다.

어떻게 쓰나

두 번째 장치는 이해의 진화를 이끄는 검증-반증(verify-falsify) 스킴이다. 목표가 최적화뿐이라면 실패가 예측되는 조건을 실험할 이유가 거의 없다. 그러나 이해란 공정이 어디서 성공하고 어디서 실패하는지에 대한 주장이고, 그런 주장은 예측한 실패가 실제로 관측될 때 확인된다. 그래서 에이전트는 성공이 예측되는 조건과 실패가 예측되는 조건을 모두 실험한다. 제안 모드는 verify로 시작해 교대로 바뀌며, 교체 가능한 전략으로 구현되어 다른 스케줄도 끼워 넣을 수 있다. 각 제안 턴에서 에이전트는 <understanding>에서 검증할 단일 주장을 고르고, 현재 모드에 맞는 조건을 선택하고, 목표값에 대한 구체적인 수치 예측을 확정한다. 성찰 턴에서는 측정된 목표값과 SEM 이미지를 받아 예측을 지지 또는 반박으로 판정한다. verify 모드에서는 측정과 예측이 모두 성공을 가리킬 때, falsify 모드에서는 둘 다 실패를 가리킬 때 지지로 판정한다. 예측값과 측정값의 차이에 수치적 허용 오차는 두지 않는다. 수치 예측은 구체적 약속 역할을 하고, 결과가 예측한 범주에 들어가는지는 에이전트 스스로 판단한다. 지지되면 어떤 주장이 더 강하게 뒷받침됐는지 시험된 영역을 넘어서지 않는 선에서 진술하고, 반박되면 귀추적 추론(abduction)으로 의심받는 주장을 지목하고 관측된 결과에 대한 가장 그럴듯한 대안 설명을 제시한다. 이후 이해 턴이 <understanding>을 다시 쓴다.

전제와 한계

실증은 dLab이라는 물리적 자동 실험실에서 LiCoO2 (001) 박막 합성으로 이뤄졌다. Al2O3 (0001) 기판 위에 Li1.2CoOx 소결 타깃을 쓴 RF 마그네트론 스퍼터링으로 증착했고, RF 전력 80 W, 증착 시간 1.5시간, 총 가스 압력 0.50 Pa(아르곤 0.45 Pa, 산소 0.05 Pa)로 고정했다. 유일한 조작 변수는 증착 중 기판 온도로, 에이전트가 200~750°C 범위에서 10°C 간격으로 선택했다. 캠페인 예산은 18회 반복으로 미리 정해졌다. XRD는 Rigaku SmartLab XE로 2θ 10~120°, 스텝 0.01°에서 측정했고, 표면 형상은 JEOL JSM-IT700HR SEM으로 픽셀 크기 5.0 nm에서 관찰했다. 목표는 XRD의 003과 006 반사 강도비 I(003)/I(006)를 최대화하는 것이었다. 18회 실험 중 15개 예측이 지지, 3개가 반박됐다. 측정된 비는 250~630°C에서 0.1 미만으로 사실상 정렬이 없었고, 650°C에서 질서 있는 성장이 갑자기 시작됐다. 650~690°C가 좁은 고품질 창이었고 700~750°C는 32~41의 평탄역이었다. 캠페인 최고값은 670°C에서 I(003)/I(006) = 61.6이었다.

캠페인의 전개는 검증-반증이 실제로 어떻게 작동했는지 보여준다. 첫 verify 제안은 600°C가 최적에 가까울 것이라는 사전 기대를 시험했고, I(003)/I(006) = 0.001로 실패했다. 에이전트는 회절 패턴과 입자로 덮인 SEM 표면을 보고 불완전 결정화, 형태적 불균일, 이차상 분리 가능성을 가설로 세운 뒤 최적점을 600°C 아래로 내렸다. 다음 반복의 falsify 제안은 이 수정된 그림에서 실패가 예측되는 700°C를 찔렀지만, 오히려 35.6의 잘 정렬된 막이 나왔다. 이 단일 반박이 수정된 그림을 뒤집었고, 에이전트는 온도로 활성화되는 결정화 임계값 개념으로 이해를 재편해 전이를 600~700°C 사이 어딘가에 놓았다. 결정적 단계는 10번째 반복이었다. 실패한 600°C 막과 성공한 700°C 막 사이의 미탐색 구간인 650°C를 falsify 제안으로 찔렀고 예측값은 0.2였는데, 측정값 54.9가 그때까지의 최고치였다. 임계값이 700°C 근처라는 주장이 반박되면서 전이 구간이 600~650°C로 좁혀졌고, 이어 660°C가 60.2, 670°C가 61.6, 680°C가 55.0, 690°C가 58.2를 냈다. 750°C는 40.9로 고온 평탄역이 견고하지만 최적은 아니라는 주장을 뒷받침했고, 620°C와 630°C는 완전히 실패해 급격한 전이를 630~650°C로 묶었다. 최종 이해는 네 영역, 즉 630°C 미만의 무정렬 영역, 630~650°C의 전이 구간, 최적점이 670°C 근처인 650~690°C의 정렬 성장 창, 700~750°C의 견고하지만 차선인 정렬 영역으로 온도축을 분할했다. 세 번의 반박이 각각 이해의 대개정을 촉발했고, 가장 큰 두 진전(700°C의 정렬 성장 발견, 650°C의 우수 창 발견)은 모두 falsify 제안에서 나왔다.

개발자 입장에서 이 논문의 실무적 신호는 세 가지다. 첫째, 에이전트가 미리 정의된 도구 세트에 묶여 있으면 누구도 예상하지 못한 특징은 추론 대상이 되지 못한다. 저온 막의 밝은 입자는 어떤 사전 정의 파이프라인에도 없던 것인데, 에이전트가 SEM 이미지에서 그것을 보고 유용하다고 판단해 정량화 수단을 스스로 확보했다. 첫 반복에서 생성된 두 스킬이 나머지 17회 실험에서 수정 없이 재사용됐다는 점은, 만들어진 것이 임시 스크립트가 아니라 분석 도구였음을 보여준다. 둘째, 스칼라 목표만으로는 구분되지 않는 상태를 다중모달 증거가 갈라준다. 250~320°C 막은 밝은 입자 면적률이 약 0.1%로 거의 무특징이었고, 400~630°C 막은 4~6%를 입자가 덮고 있었다. XRD 목표값으로는 둘 다 0.1 미만으로 동일하지만 SEM 기술자가 이 둘을 구분해 기계론적 가설을 형성하게 했다. 셋째, LLM 에이전트를 실험 루프에 넣을 때는 확증 편향을 구조적으로 막는 장치가 필요하다. 논문은 같은 플랫폼에서 같은 온도 그리드와 목표로 베이지안 최적화가 수행된 기존 캠페인과 비교하는데, SynAgent도 최적 조건에 도달했다. 차이는 캠페인 끝에 남는 것이다. BO는 최적점과 그것을 낳은 데이터를 남기지만, SynAgent는 온도축을 네 영역으로 분할하고 630~650°C의 급격한 임계값을 짚고 700~750°C 평탄역이 견고하지만 차선이라고 진술하는 문서를 추가로 남긴다. 각 주장은 그것을 지지하거나 반박한 실험에 연결된다.

저자들이 밝힌 한계는 분명하다. 이번 실증은 조작 변수가 하나뿐인 단일 재료 시스템에 국한됐고, 조건 공간이 고차원일 때 이 기법이 통하는지는 다음 과제로 남는다. verify와 falsify 모드는 단순히 교대했을 뿐이며, 현재 이해의 성숙도에 따라 에이전트가 모드를 고르는 더 적응적인 전환 전략이 이해 진화를 더 효율적으로 만들 수 있다. 각 조건은 한 번만 방문했기 때문에 650~690°C 창 안의 최고 비들 사이의 작은 차이는 실행 간 변동(run-to-run variation) 범위 안에 있을 수 있고, 이를 정량화하려면 반복 실험이 필요하다. 베이지안 최적화와의 통제된 비교도 동일 예산에서 두 의사결정 계층을 다시 돌려야 하는데, 물리 실험이 순차적이라는 성질 때문에 이번에는 불가능했다. 생성된 스킬의 정확성은 현재 그 스킬의 자체 테스트 범위 안에서만 검증되며, 지지와 반박 판정부터 귀추적 설명까지 캠페인의 모든 판단은 LLM 자체의 추론에 의존한다. 사전 지식은 분석 도구의 설계를 통해 캠페인에 유입될 수 있으므로, 생성된 스킬과 기록된 판정을 인간 연구자나 전용 검증 에이전트가 검토하는 human-in-the-loop 또는 agent-in-the-loop 접근이 효과적인 보완이 될 것이라고 저자들은 적는다.