구글 딥마인드, 90억 개 DNA 변이 예측을 미리 계산한 '알파지놈 아틀라스' 공개

Hacker News2026. 9. 9.조회 6

구글 딥마인드가 유전체 변이 해석 모델인 알파지놈(AlphaGenome)의 예측 결과를 대규모로 미리 계산해 공개했다. 이름은 알파지놈 아틀라스(AlphaGenome Atlas)로, 인간 참조 게놈에서 가능한 모든 단일 염기 치환 변이 90억 개에 대해 모델 추론 결과를 미리 만들어 온라인 저장소 형태로 제공하는 것이다. 연구자가 원하는 변이를 골라 코드를 작성하고 모델을 직접 실행해야 했던 기존 방식과 달리, 이제는 조회만 하면 된다.

규모부터 짚어보자. 인간 게놈은 약 30억 개 염기쌍으로 이뤄지고, 각 위치마다 세 가지 치환이 가능하므로 변이 조합은 90억 개가 된다. 이를 모두 계산한 데이터셋은 약 1페타바이트에 달한다. 아틀라스는 변이 하나를 조회했을 때 11종의 서로 다른 출력 유형을 보여주며, 그중 가장 눈에 띄는 것은 변이의 의미를 한눈에 판단할 수 있도록 만든 단일 숫자 형태의 영향 점수(impact score)다.

알파지놈 자체는 2025년 처음 공개됐고, 올해 1월 네이처에 상세 내용이 실린 논문과 함께 비상업적 용도로 풀렸다. 원래 DNA 서열과 변이 서열을 비교해 유전자 발현과 조절 활동에 어떤 변화가 생기는지 예측하는 모델이다. 딥마인드의 유전체 연구 계보도 이어진다. 2020년 알파폴드가 아미노산 서열에서 단백질 3차원 구조를 예측했고, 2023년 알파미스센스는 단백질을 바꾸는 7100만 개 변이의 양성·병원성 여부를 예측해 공개 데이터베이스로 제공한 바 있다.

이번 작업에서 가장 큰 난관은 연산이었다. 딥마인드 유전체 리드인 지가 아브섹에 따르면 프로젝트 초기에는 합리적인 시간 안에 아틀라스를 완성하려면 계산 속도를 80배 끌어올려야 한다는 추산이 나왔다. 팀은 모델 증류(model distillation), GPU 커널 최적화, 중복 계산 제거 같은 기법을 조합해 이 목표를 달성했다. 대규모 추론 파이프라인을 다루는 엔지니어 입장에서는 모델 정확도만큼 처리량과 비용 구조를 어떻게 바꿨는지가 참고할 만한 지점이다.

실무적 의미는 분명하다. 알파지놈은 성능이 뛰어나다는 평가를 받지만, 브리티시컬럼비아대의 유전체학자 칼 드 부어는 이 모델이 "매우 느리고 계산 집약적"이라고 짚는다. 최신 하드웨어에 접근하기 어려운 연구자에게 아틀라스는 진입 장벽을 낮춰주고, 같은 시뮬레이션을 반복 수행하는 낭비도 줄여준다. 딥마인드 과학 부문 VP 푸시미트 콜리는 DNA를 이해하는 일이 근본적인 난제라며, 이 언어를 해독하는 것이 많은 것을 열어줄 수 있다고 말한다. 아틀라스는 비상업적 연구 목적에는 무료로 열려 있고, 상업적 활용은 별도 라이선스가 필요하다.

한계도 분명히 밝혀져 있다. 많은 질병이 단일 변이가 아니라 여러 변이의 조합과 연관되며, 알파지놈은 변이 주변 100만 염기쌍이라는 비교적 넓은 구간을 보지만 인핸서처럼 훨씬 먼 거리에서 유전자를 조절하는 서열은 모델의 시야 밖으로 벗어날 수 있어 효과 예측이 어렵다. 단일 숫자로 요약된 영향 점수 역시 여러 예측 축을 압축한 것이어서 오독 가능성이 크다는 지적이 나온다. 결국 아틀라스는 실험을 대체하는 도구가 아니라, 후보 변이를 걸러내고 검증 실험의 우선순위를 정하는 필터로 쓰는 것이 적절하다.

관련 글