구글 Gemini 4 Argon, 100만 토큰 출력으로 장기 작업에 도전한다

Hacker News10일 전조회 9

구글이 Gemini 4 Argon을 공개했다. 복잡하고 긴 작업 흐름에서 깊은 추론을 유지하도록 만든 프런티어 모델로, 실제 소프트웨어 엔지니어링과 법률·금융 같은 기업 지식 노동, 그리고 사이버 보안 방어를 겨냥한다. 일반 공개에 앞서 Fairwind 프로그램을 통해 신뢰된 사이버 방어자들에게 먼저 배포된다.

가장 눈에 띄는 변화는 출력 토큰 한도다. 기존 6만4000개에서 100만 개로 늘었다. 한 번의 추론 궤적에서 수십만 토큰을 생성할 수 있다는 뜻이며, 여러 단계를 거치는 난제를 한 번에 밀어붙이는 데 초점이 맞춰져 있다. 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이고, 캐시된 입력 토큰에는 입력 가격의 95% 할인이 적용된다.

성능 지표도 함께 제시됐다. 실제 장기 소프트웨어 엔지니어링 작업을 측정하는 DeepSWE v1.1에서 77.9%로 새 기준을 세웠고, 금융·코딩·법률·세무의 경제적 영향을 미국 GDP 기여도로 가중한 Vals Index에서 선두에 올랐다. Vals Finance Agent v2와 Harvey의 Legal Agent Benchmark 같은 도메인 평가에서도 앞선다. Zapier의 AutomationBench에서는 51.3%로 1위, 긴 영상 이해를 재는 LVBench에서는 91.7%를 기록했다.

구글 내부에서는 이미 실무에 투입됐다. 양자 컴퓨팅 연구진은 중요 애플리케이션의 병목인 서브루틴이 쓰는 시공간 자원(큐비트×게이트)을 최적화하는 데 Argon을 활용했고, 한 사례에서 공개된 기준선을 40% 앞섰다. 또 Argon 에이전트 팀이 데이터센터 전반의 프로파일링 텔레메트리를 분석해 메모리 최적화를 스스로 찾아 적용했으며, 배포 후 300TiB 이상의 메모리를 확보하고 총 500TiB에서 1PiB 규모의 절감을 추정하고 있다.

코드 마이그레이션 작업도 병행된다. re2, libgav1 같은 핵심 라이브러리의 수만 줄짜리 코드부터 Fuchsia OS Zircon 커널의 80만 줄 이상에 이르기까지 C/C++ 코드베이스를 Rust로 옮기는 데 Argon 에이전트가 투입됐다. libgav1에서는 기존 Rust 포팅에 있던 SIMD 코드 3만2000줄을 대체해, 동일한 영상 출력을 내면서 기존 Rust 포팅보다 2.7배 빠른 메모리 안전 디코더를 만들어냈다. 시스템 중요도를 감안해 대규모 재작성은 자동·수동 감사와 에뮬레이션 테스트, 리뷰를 거친 뒤 프로덕션에 반영된다.

보안 쪽 성능도 강조됐다. Argon은 취약점을 스스로 찾아 검증하고 패치하도록 훈련됐으며, 취약점 제거 능력을 평가하는 CWE-bench v1에서 68%로 공동 1위에 올랐다. Wiz는 공공 인프라의 고위험 노출을 무료로 찾아내는 Scan for Good 이니셔티브에서 Argon을 사용해, 전 세계 병원이 쓰는 의료 소프트웨어에서 민감한 개인정보를 노출하는 치명적 취약점을 발견했다. 이는 이전 프런티어 모델들이 놓쳤던 위험이다. 소스 코드 없이 실제 웹 시스템을 분석하는 Wiz의 블랙박스 침투 테스트 벤치마크에서도 Argon은 3.8 Flash Cyber를 앞선다.

배경에는 프런티어급 능력을 안전하게 내놓으려면 단계적 접근이 필요하다는 판단이 있다. 구글은 미국 정부의 자발적 사전 릴리스 모델 접근 절차에 참여하면서 접근 범위를 조금씩 넓히고 있고, 초기 테스터의 피드백을 모아 가드레일을 다듬은 뒤 개발자와 기업, 소비자에게 순차적으로 풀 계획이다. 신뢰된 방어자와 구글 내부 팀에게는 사이버 가드레일 없이 제공된다.

개발자 입장에서 100만 토큰 출력 한도는 에이전트 루프 설계를 바꾸는 요소다. 중간 산출물을 잘게 쪼개 여러 번 호출하는 대신 한 번의 긴 궤적으로 처리하는 패턴이 현실적인 선택지가 된다. 캐시 입력 할인은 같은 컨텍스트를 반복해서 재사용하는 워크플로의 비용 구조에 직접 영향을 준다. 다만 아직 일반 개발자가 바로 호출할 수 있는 단계는 아니다.

한계도 분명하다. 일반 공개 시점은 정해지지 않았고, 오남용 방지와 화학·생물·방사능·핵(CBRN) 공격 차단, 모델 내부 활성값 모니터링 등 네 영역에서 프런티어 안전장치를 강화하는 중이라고 밝혔다. 제시된 요금 역시 도입 가격 성격이어서 이후 조정될 수 있다.