GOAI 결선 20개 프로젝트가 AI의 과학 발견 진입의 검증·재현성을 다시 묻다

InfoQ 中文19일 전조회 4

중국에서 열리는 세계 인공지능 오픈소스 대회(GOAI)의 '프런티어 탐색 AI for Research' 트랙 결선에 20개 프로젝트가 올랐다. InfoQ 중국판 보도에 따르면 이 프로젝트들은 소재, 핵융합, 거울상 펩타이드, 고문자, 안테나, 연소 안정성, 해양 생태, 양자 광학, 가상 세포, 단백질-리간드 동역학 등 서로 다른 분야를 다루지만 공통된 방향을 향한다. AI가 정해진 질문에 답을 내는 도구를 넘어, 질문을 만들고 후보를 생성하고 증거를 조직하고 결과의 경계를 확인하는 단계까지 들어간다는 것이다. 트랙은 정해진 과학 문제와 평가 프레임을 겨루는 알고리즘 부문과, 문제 정의와 탐색 과정 자체를 다루는 개방 탐색 부문으로 나뉘어 운영됐다.

가장 눈에 띄는 변화는 '무엇을 발견으로 인정할 것인가'를 프로젝트가 직접 다룬다는 점이다. SAGE-Mat는 문헌에서 뽑아낸 후보 질문이 실제로 새로운지 확인하기 위해 동의어 재검색, 반례 검색, 실험 의미 검증을 거치도록 설계했다. Gapilot은 문헌 진화 경로와 소재 모델 두 갈래로 후보를 걸러낸 뒤 위상 특성이 별도 계산 검증을 통과할 것을 요구한다. 섬유 네트워크 초재료 프로젝트는 최고 성능 구조를 찾는 대신 노드와 연결 형태가 역학 응답에 어떻게 작용하는지를 다루고, '상대 밀도보다 위상이 성능에 더 직접적일 수 있다'는 가설을 검증 대상으로 세웠다. 연소 안정성 프로젝트는 특정 형상의 안정 여부를 판정하는 데서 멈추지 않고 안정 영역과 불안정 영역 사이의 경계 자체를 발견 대상으로 삼았다.

평가 기준을 의심하는 시도도 있었다. 3차원 자유형 공간 안테나 프로젝트는 원리가 독립적인 전자기 해석기 두 개를 교차 검증에 사용했는데, 한쪽에서 기준선보다 17.6% 높은 점수를 낸 후보를 다른 쪽이 공진하지 않는다고 판정했다. 팀이 남긴 성과는 17.6%가 아니라 가짜 발견 하나를 식별한 것이다. '누가 자를 채점하는가'라는 프로젝트는 정답이 없는 해양 시뮬레이션에서 대리 지표가 점수를 부풀릴 수 있는 경로를 먼저 찾아낸 뒤, 기존 정렬 능력을 최대한 유지하면서 더 신뢰할 수 있는 지표를 역으로 설계했다. QuantumOpt-Explorer는 실험 예산과 난수 시드, 중단 규칙을 고정해 서로 다른 탐색 전략을 동일 비용 조건에서 비교했고, GenVR-Fusion은 핵융합로 심층 차폐의 희귀 사건을 다루면서 샘플링 전략을 바꾼 뒤 중요도 보정을 적용해 물리 문제와 평가 기준 자체는 건드리지 않았다.

실패를 기록으로 남기는 흐름도 뚜렷하다. 안테나 프로젝트는 정적 이중 대역 탐색의 부정 결과와 해석기 문제, 그로 인해 문제 정의가 어떻게 조정됐는지를 함께 보관했다. QuantumOpt-Explorer도 발견 기준에 도달하지 못한 탐색 결과를 그대로 유지했고, MirrorPeptidizer는 천연 표적 단백질을 겨냥한 거울상 펩타이드 설계를 시도하면서 거울상 데이터 부족, 모델 외삽 한계, 평가 기준 미비를 함께 명시했다. 폐기 전략 자원 회수 프로젝트는 생산자와 검토자 역할의 에이전트를 분리해 경로를 제안하고 점검하게 하면서, 열역학적으로 허용된다는 판정과 실험이 성공했다는 판정을 명확히 구분했다.

일반화 조건을 정면으로 다루는 프로젝트도 많다. YeastPerturb는 학습 단계에서 보지 못한 균주와 화합물이 동시에 등장하는 이중 미지 문제를 설정하고, 배치 효과와 절대 상태, 화합물 특이 변화를 각각 다른 모델로 처리한 뒤 대조군 매칭과 음성 대조, 소거 실험으로 개선이 어디서 왔는지 확인했다. 가상 세포 효모 프로젝트 역시 이중 외삽을 핵심 문제로 두고 낯선 개체 조합에 대한 전이 능력을 따졌다. ContextLadder는 구체 조합의 맥락이 없을 때 범주 정보와 전역 통계로 단계적으로 물러서며, 가장 세밀한 증거가 빠진 상태에서 근거 없는 추론을 이어가지 않도록 했다. 분자 동역학 쪽에서는 SpatiotemporalPE 기반 트랜스포머가 분자 상태 변화 강도로 시간을 다시 표현하고, BindMD는 단백질-리간드 결합 궤적에서 개선의 출처를 대조 가능한 메커니즘으로 확인하려 했다. QField-Dyn은 양자화학 계산으로 반응장을 감독하고 추론은 일반 네트워크가 맡는 구조를 취하면서, 보지 못한 단백질-리간드 복합체에서의 일반화를 설계 목표로 내걸었다.

배경에는 벤치마크 중심 평가의 한계가 있다. 최적화기가 시뮬레이션 허점을 파고들거나 대리 지표가 악용될 수 있다면 리더보드의 높은 점수가 과학적 진전을 뜻하지 않을 수 있다. 그래서 이 프로젝트들이 공통으로 요구하는 것은 더 강한 탐색기가 아니라, 무엇을 발견으로 인정할지 판정하는 장치다. 연구 조건과 실패 경로, 검증 기록, 적용 경계가 함께 남아야 다음 연구가 이전 탐색을 다시 처음부터 반복하지 않는다.

개발자 입장에서 이 흐름은 평가 파이프라인 설계 방식의 변화로 이어진다. 지표 하나를 최적화하는 대신 지표가 어떻게 악용될 수 있는지 먼저 점검하고, 부정 결과와 중단 조건을 저장하며, 모델이 어떤 조건에서만 유효한지 명시하는 작업이 실무 요구사항이 된다. 다만 여기 소개된 프로젝트별 성과는 각 팀이 대회에 제출한 내용을 보도가 정리한 것으로, 독립적인 재현이나 제3자 검증이 이뤄졌다는 정보는 원문에 없다. 수치와 판정은 해당 팀의 보고로 이해하는 편이 안전하다.

관련 글