퀄컴, 온디바이스 AI 겨냥한 스냅드래곤 8 엘리트 Gen 6 두 종 공개
퀄컴이 연례 스냅드래곤 서밋에서 플래그십 스마트폰용 프로세서 두 종을 발표했다. 이름은 스냅드래곤 8 엘리트 Gen 6와 스냅드래곤 8 엘리트 익스트림 Gen 6이며, 두 칩 모두 기기 안에서 AI 기능을 돌리는 능력에 무게를 뒀다.
가장 눈에 띄는 변화는 새로 들어간 센싱 허브다. 이 허브는 최대 2억 파라미터급 소형 모델을 실행할 수 있다. 이를 통해 스마트폰에서 개인용 받아쓰기(scribe)를 로컬로 돌리고, 발화자를 구분하며, 사용 패턴을 바탕으로 메모리를 쌓아 작업 자동화 제안의 정확도를 높이는 시나리오가 제시됐다. 음성 입력부터 음성 출력까지 이어지는 완결형 에이전트를 이 칩 위에서 구동할 수 있다는 설명도 나왔다.
상위 라인업인 익스트림 버전은 300억 파라미터 규모의 전문가 혼합(MoE) 모델을 기기 안에서 실행한다. 전체 파라미터 수는 300억이지만, 특정 작업에서는 일부 파라미터만 활성화되는 구조라 연산 부담을 줄일 수 있다. 퀄컴은 여기에 더 효율적으로 모델을 돌리기 위한 별도 가속기 요소를 Gen 6에 넣었다고 밝혔다. 비교 대상으로, 애플은 지난 6월 WWDC에서 200억 파라미터 MoE 모델을 공개한 바 있다.
카메라와 영상 처리 쪽 변화도 함께 나왔다. 새 CPU는 카메라를 픽셀 단위로 제어할 수 있게 해 보다 전문가급 촬영 경험을 지원하고, 손떨림 보정과 움직임 인식 성능을 끌어올렸다. 익스트림 버전은 8K 60fps 촬영과 4K 240fps 초고화질 슬로모션을 지원하며, 전문가급 녹화를 위한 APV(Advanced Professional Video) 코덱도 사용할 수 있다.
오디오 처리에도 AI가 들어간다. 두 칩 모두 AI로 보컬을 강조하고 노이즈를 줄인다. 통화 중 사용자 주변 소음을 분리해내는 '보이스 버블' 기술도 새로 추가됐다.
하드웨어 파트너 발표도 이어졌다. 모토로라는 스냅드래곤 8 엘리트 익스트림 Gen 6를 탑재한 모토로라 시그니처 27을 공개했고, 올해 안에 정식 출시할 예정이다.
배경에는 스마트폰이 AI의 주 무대가 될 것이라는 퀄컴의 판단이 깔려 있다. 퀄컴은 40종이 넘는 AI 기기를 준비해 왔지만, 전용 하드웨어보다 스마트폰으로 AI를 쓰는 사용자가 여전히 다수일 것이라는 시각을 유지하고 있다. 업계에서도 비슷한 전망이 여러 차례 나온 상태다.
개발자 입장에서 주목할 지점은 온디바이스 추론의 상한선이 눈에 띄게 올라간다는 점이다. 300억 파라미터 MoE를 로컬에서 돌린다는 것은, 클라우드 왕복 없이 요약·번역·에이전트 루프를 처리할 여지가 넓어진다는 뜻이다. 센싱 허브가 2억 파라미터급 모델을 상시 구동하는 구조라면, 항상 켜져 있는 경량 워커 모델과 필요할 때만 호출하는 대형 모델을 나누는 설계가 자연스러워진다. 발화자 분리와 사용 이력 기반 메모리 같은 기능은 별도 서버 없이 개인화를 구현하는 방향과 맞닿아 있다.
다만 이번 발표는 실행 가능성에 대한 설명이 중심이며, 구체적인 벤치마크 수치나 전력·발열 조건은 제시되지 않았다. MoE가 실제로 어떤 작업에서 얼마나 많은 파라미터를 활성화하는지, 300억 파라미터 모델이 지속적으로 돌아가는지도 확인이 필요하다. 실제 성능은 탑재 기기가 시장에 나온 뒤 검증될 사안이다.
관련 글
- PrismML, 퀄컴 스냅드래곤 스마트글래스에 1비트 초소형 LLM 얹었다PrismML이 퀄컴 스냅드래곤 AR1 Gen 1 플랫폼에서 로컬로 도는 1비트 초소형 언어모델을 선보였다. 20억 파라미터 비전·언어 모델로 스마트글래스에서 실시간 시각 질의를 처리하는 온디바이스 AI 사례다.
- 애플, 3세대 파운데이션 모델 AFM 3 공개…200억 파라미터 온디바이스 모델에 희소 아키텍처 적용애플이 구글과 함께 개발한 3세대 파운데이션 모델 AFM 3 제품군을 공개했다. 200억 파라미터 온디바이스 모델에 희소 아키텍처를 적용하고, 프라이빗 클라우드 컴퓨트를 엔비디아 GPU까지 확장한 것이 핵심이다.
- 센스타임, 이기종 칩으로 추론 자원 재배치…일일 토큰 0.46조→4.5조센스타임 대장치가 이기종 칩을 묶어 대규모 추론을 처리하는 '토큰 팩토리' 아키텍처를 공개했다. Prefill·Decode 자원을 부하에 따라 동적으로 재배치하고, 일일 토큰 처리량을 8개월 만에 0.46조에서 4.5조로 늘렸다고 밝혔다.
- Infinite-Parameter LLM은 프롬프트 대신 가중치에 기억한다MoE에서 착안한 'Infinite-Parameter LLM' 아키텍처가 arXiv에 공개됐다. 하이퍼네트워크가 런타임 데이터를 저랭크 가중치 변조로 바꿔, 프롬프트 대신 모델 가중치에 지식을 축적하는 방법을 탐구한다.
- 8GB 노트북 GPU로 멈추지 않고 학습하는 바이트 단위 언어모델 'mini-AGI' 공개8GB VRAM GPU 한 장에서 처음부터 학습하고, 읽는 모든 텍스트로 계속 배우는 바이트 단위 언어모델 mini-AGI가 공개됐다. 가중치를 디스크에 두고 필요할 때만 페이징해 파라미터 상한을 VRAM이 아닌 저장 공간으로 옮긴 실험이다.