단백질 접힘 학습이 언어모델의 일반 추론을 끌어올린다

Does Learning Protein Folding Generalize to Broader Reasoning?

HF Daily2609.38879

Yong Liu, Zhanpeng Shi, Yizhou Dang2026-09-30조회 3

무엇인가

이 논문이 다루는 문제는 언어모델의 감독 신호가 인간이 쓴 텍스트와 코드에 지나치게 의존한다는 것이다. 인간 텍스트는 공간적·구조적 논리보다 표면적인 답을 전달하는 경우가 많고, 학습 데이터로서의 양에도 한계가 있다. 저자들은 구조적으로 제약된 과제가 모델이 학습 도메인 밖에서도 재사용할 수 있는 계산을 습득하게 하거나, 이미 가진 계산을 더 안정적으로 호출하게 만들 수 있다는 가설을 세운다. 단백질 접힘을 테스트베드로 고른 이유는 하나의 풀린 구조가 수천 개의 정확히 검증 가능한 공간·위상 명제를 만들어내기 때문이다. 저자들은 전이를 일으키는 기저 계산을 규명하겠다고 주장하지 않고, 행동적 전이만 측정한다고 선을 긋는다.

어떻게 동작하나

데이터는 FoldingCorpus다. OpenFold의 단량체 단백질 컬렉션에 12개의 결정적 구조 연산자를 적용해 질의응답을 만든다. 핵심 구성은 1,200개 단백질과 14,400개 질의응답 레코드이며, 1,000개 학습·100개 개발·100개 동결 테스트 단백질로 나뉜다. 연산자는 접촉, 거리 비교, 세그먼트 방향, 중심 근접성, 국소 방향, 카이랄리티, 다중 제약, 전역 요약 등을 포함한다. 답은 9개가 이진, 2개가 삼지선다, 1개가 32지선다 텍스트 요약 매칭이고 모든 선택지가 하나의 vocabulary 토큰으로 떨어진다. 정답은 좌표로부터 프로그램이 계산하고 독립적으로 재계산해 감사 기록에 남기며, 좌표 자체는 모델 입력에서 제외된다.

무엇과 다른가

방법인 Fold2Reason은 Qwen3.5-9B를 공유 워크스페이스 하나를 통해 두 신호로 포스트트레이닝한다. 워크스페이스는 잔기 마커 상태를 256차원으로 줄이고, 시퀀스 오프셋 1~4의 근거리 쌍과 균등 샘플링한 장거리 쌍(단백질당 최대 2,048쌍) 사이로 메시지를 교환한 뒤 두 가지를 반환한다. 잔기 정렬된 E(L×4096)와 16개 학습 쿼리가 잔기 집합을 풀링한 증거 토큰 M(16×4096)이다. FoldingCorpus 경로는 M을 질문 시퀀스 앞에 붙이고 12개 답 토큰과 EOS만 지도해 답 손실을 만든다. 기하 경로는 E를 동결된 좌표·distogram 디코더에 통과시켜 좌표, 쌍거리, 접촉, distogram, 국소 프레임, torsion, 회전반경 손실의 합을 만든다. 전체 목적함수는 두 손실의 합이다. 디코더를 동결한 이유는 새 좌표 헤드가 목적함수를 흡수하지 못하게 하고 그래디언트가 공유 워크스페이스와 LoRA를 반드시 바꾸도록 강제하기 위해서다. LoRA는 rank 16, alpha 32, dropout 0.05로 43.28M 파라미터, 워크스페이스 3.90M, 동결 디코더 3.31M이다. 평가 시에는 워크스페이스와 디코더를 버리고 학습된 LoRA 어댑터만 원래 벤치마크 인터페이스에 적용한다. 따라서 측정된 전이는 단백질 특화 모듈이 아니라 적응된 모델 안에 존재해야 한다.

어떻게 쓰나

학습은 1,000개 단백질(서열만 336, 서열+MSA 332, 서열+MSA+템플릿 332), 길이 29~199, 12,000개 레코드를 단백질당 한 예시로 패킹해 3 에폭, 375 옵티마이저 스텝, A800-80G 4장, 시드 3개로 수행한다. 평가 지표인 General-10은 FTB-Core, SpatialViz, VSI, GraphQA Easy/Hard, BBH, ChemBench, ChemBench4K, Lab-Bench, SciBench 10개 데이터셋의 비가중 매크로이며 총 76,725개 예시를 모두 포함한다.

전제와 한계

결과는 매크로 정확도 45.09%에서 48.33%로 3.23pp 상승(SD 0.15pp)이고 시드별로는 3.19, 3.12, 3.40pp다. 10개 데이터셋 모두 평균 변화가 양수였고, 가장 큰 상승은 GraphQA Hard +6.83pp, SpatialViz +6.10pp, GraphQA Easy +4.56pp, ChemBench4K +4.37pp다. 텍스트 전용 7개 데이터 매크로는 +2.93pp, GraphQA Easy/Hard를 제외한 8개 매크로는 +2.62pp, 내부 생성 FTB-Core를 제외한 External9는 +3.14pp다. FoldBench 구조 예측에서는 Qwen3.5-9B 대비 2.7~3.5배 점수를 냈고, 334개 타깃에서 TM-score 16.88 대 4.55, lDDT-Cα 25.32 대 9.38, Contact F1 6.90 대 3.05를 기록했다(모두 ×100).

통제 실험이 이 논문의 핵심 방어선이다. 단백질 프롬프트는 유지하되 관측되지 않은 무작위 점 구조로 답을 다시 계산한 Hidden Geometry는 +0.92pp, 정답 코드를 복사하도록 학습한 Format Copy는 −0.09pp, 연산자와 후보 어휘를 맞춘 고정 셔플 라벨은 −0.27pp였다. 실제 단백질 유래 Fold2Reason의 +3.23pp는 가장 강한 통제군의 두 배를 넘으므로 답변 형식이나 고정 셔플 감독만으로 설명되지 않는다. 모델 일반성도 확인했다. FoldingCorpus 감독만 쓰는 Pure-LoRA 비교에서 Qwen3.5-2B +5.41pp, 4B +4.84pp, 9B +3.22pp, InternVL3.5-8B +1.53pp였고 Gemma-4-12B-IT는 +0.07pp로 중립이었다. 50~4,000개 단백질로 확장하면 이득이 0.49, 0.61, 1.37, 2.92, 3.31, 3.70, 3.02pp로 2,000개에서 정점을 찍고 이후 감소한다. 절제 실험에서 FoldingCorpus 질의응답만으로 +2.93pp가 나와 광범위 전이의 대부분을 차지했고, 기하 신호는 전체 +0.30pp(시드별 0.57, 0.49, −0.15pp)로 시드 민감하며 3D 매크로 +1.08pp(FTB-Core +1.26, SpatialViz +0.90, VSI +1.08pp), 텍스트 G7은 −0.03pp였다. 구조 판독에서는 lDDT-Cα +0.00973, Contact F1 +0.00629가 늘고 TM-score −0.00214, Cα 거리 MAE +0.148Å로 국소 구조에 집중됐다.

개발자 관점에서 이 논문의 실용적 메시지는 포스트트레이닝 감독 신호를 인간 텍스트 밖에서 조달할 수 있다는 것이다. 정답을 프로그램으로 자동 검증할 수 있는 도메인이라면, 그 데이터가 원래 도메인 밖의 추론 과제까지 끌어올릴 가능성이 있다는 사례를 수치와 통제군으로 제시한다. 다만 효과가 아키텍처에 의존하고(Gemma는 중립), 기하 손실의 기여는 시드에 따라 부호가 바뀌며, 전이의 정체가 재사용 가능한 추론인지 사전학습 능력의 안정적 호출인지 답변 형식 적응인지는 저자들 스스로 미해결로 남긴다. 자체 데이터로 같은 실험을 할 때는 무작위 구조, 형식 복사, 고정 셔플 같은 통제군을 반드시 함께 돌려 이득이 데이터의 구조적 내용에서 오는지 확인해야 한다.

한계도 명시적이다. 모든 주장은 1,000개 학습 단백질, rank-16 어댑터, 시드 3개, General-10에 근거한다. 동결 디코더는 구조 해독 가능성을 측정하는 것이지 정확한 전역 재구성을 측정하는 것이 아니며, 실제 Full 점수(TM-score 0.1688, lDDT-Cα 0.2532)는 경쟁력 있는 단백질 폴딩과 거리가 멀다. 단백질 분할은 클러스터 분리지만 FoldBench는 정확 서열과 5-mer 스크리닝만 사용하고 알려진 scaling-pool 중복이 남아 있어 원격 상동성이나 신규 폴드 일반화는 검증되지 않았다. 과제 이질성과 답변 형식 모호성도 행동적 이득의 해석을 제한한다.