애플, 3세대 파운데이션 모델 AFM 3 공개…200억 파라미터 온디바이스 모델에 희소 아키텍처 적용

Hacker News28일 전조회 4

애플이 3세대 애플 파운데이션 모델(AFM 3) 제품군을 공개했다. 온디바이스 모델 2종과 프라이빗 클라우드 컴퓨트(PCC)에서 실행되는 서버 모델 3종, 모두 5개 모델로 구성되며 구글과 공동 개발했다. 새로워진 시리와 기본 앱에 들어가는 지능형 기능들이 이 모델군 위에서 돌아간다.

온디바이스 쪽은 두 갈래다. AFM 3 Core는 30억 파라미터 규모의 덴스 모델로 이전 세대보다 품질을 끌어올렸다. 상위 모델인 AFM 3 Core Advanced는 200억 파라미터를 갖췄지만 요청에 따라 10억~40억 파라미터만 활성화하는 희소 구조를 쓴다. 네이티브 멀티모달이라 표현력 있는 음성과 정확도 높은 받아쓰기에 쓰이며, 애플 실리콘 최상위 기기에서만 동작하도록 최적화됐다.

서버 쪽은 세 종류다. AFM 3 Cloud는 속도와 효율을 우선한 범용 모델이고, ADM 3 Cloud(Image)는 이미지 생성·편집과 젠모지, 새로 나온 이미지 플레이그라운드를 담당한다. AFM 3 Cloud Pro는 에이전트형 도구 사용이나 복잡한 추론처럼 가장 무거운 작업을 맡는다. Core, Core Advanced, Cloud, ADM 3 Cloud는 애플 실리콘이 목표 하드웨어지만, Cloud Pro는 구글 클라우드의 엔비디아 GPU에서 돌도록 구글·엔비디아와 함께 PCC를 확장했다. 사용자 데이터 보호 보증은 그대로 유지한다는 설명이다.

기술적으로 눈에 띄는 대목은 AFM 3 Core Advanced의 메모리 전략이다. 일반적인 LLM은 덴스든 희소 활성화든 전체 가중치가 DRAM에 상주해야 해서 소비자 기기에서 확장에 한계가 있다. 애플은 모델 전체를 낸드 플래시에 두고, 프롬프트 단위로 라우팅을 결정하는 방식으로 이 제약을 우회한다. 처음 처리할 때 가벼운 덴스 블록이 전문가 집합을 고르고, 생성 과정에서 주기적으로 다시 선택한다. 항상 활성화되는 공유 전문가 비중을 높게 가져가고, 입력에 따라 달라지는 라우티드 전문가만 필요할 때 DRAM으로 옮겨 데이터 이동을 줄인다. 애플은 이 설계의 바탕을 자체 연구진이 개발한 Instruction-Following Pruning(IFP)이라고 밝혔다. 덕분에 요청 난이도에 맞춰 활성 파라미터 수를 조절하는 추론 시점 탄력성도 확보했다.

서버 모델도 구조가 손봐졌다. AFM 3 Cloud는 지난해 도입한 PT-MoE(Parallel-Track Mixture-of-Experts) 기반을 개선해 학습 안정성을 높이고, 긴 문맥 안에서 정보를 추론하고 정확히 되불러오는 능력을 강화했다. 이미지 모델 ADM 3 Cloud는 다양한 화면비와 해상도에 일반화되며, 기본 모델이 생성·편집·젠모지를 처리하고 사진 앱의 공간 리프레이밍이나 이미지 플레이그라운드의 터치 기반 편집·개인화에는 별도 어댑터를 붙이는 구성이다.

학습 데이터는 공개 정보, 제3자로부터 라이선스하거나 구매한 데이터, 오픈소스 데이터, 전용 연구로 얻은 데이터, 합성 데이터를 섞어 쓴다. 애플은 사용자의 사생활 데이터나 사용자 상호작용은 파운데이션 모델 학습에 쓰지 않는다고 명시했고, 웹 출판사가 학습에서 빠질 수 있는 권리도 존중한다고 밝혔다. 사전학습은 최신 세대 클라우드 TPU에서 대규모로 진행됐고, 모든 모델이 공통 기반을 공유한 뒤 오디오·이미지 이해, 장문맥 추론, 고품질 시각 생성 같은 멀티모달 능력을 더하며 각자 용도에 맞게 특화됐다. 사후학습은 지도 미세조정과 다단계 강화학습을 조합했고, 양자화 인식 학습(QAT)으로 정확도를 유지하면서 모델을 압축했다.

배경을 보면 애플은 자체 실리콘과 운영체제를 함께 쥔 회사라는 점을 전면에 내세운다. 클라우드로 모든 추론을 넘기지 않고 기기 안에서 처리할 수 있는 부분은 최대한 기기에서 끝내고, 무거운 작업만 프라이빗 클라우드 컴퓨트로 보내는 이원화 전략이 3세대까지 이어진 셈이다. 여기에 구글과의 모델 협업, 엔비디아 GPU로의 PCC 확장이 더해지면서 자체 스택만으로는 감당하기 어려운 최상위 추론 수요를 외부 하드웨어로 흡수하는 구도가 만들어졌다.

개발자 입장에서 실무적으로 달라지는 지점은 몇 가지다. 우선 온디바이스에서 200억 파라미터급 모델이 희소 활성화로 돌아간다는 것은, 모바일 환경에서 모델 크기와 지연 시간을 맞바꾸는 방식이 한 단계 진화했다는 뜻이다. 프롬프트 단위 라우팅과 공유·라우티드 전문가 분리 같은 설계는 서버 추론 최적화를 하는 팀에도 참고할 만하다. 또 애플 실리콘 전용 모델과 엔비디아 GPU 전용 모델이 나뉘어 있으므로, 어떤 기능이 어느 하드웨어에서 어떤 지연 시간으로 응답하는지, 개발자 API로 어디까지 노출되는지를 확인해둬야 한다. QAT 기반 압축이 정확도에 어떤 영향을 주는지도 실제 평가 결과와 함께 봐야 할 항목이다.

주의할 점도 있다. 프라이버시 보증은 애플이 제시한 설명이며, PCC가 엔비디아 GPU로 확장된 만큼 데이터가 어디까지 이동하고 어디서 처리되는지는 보안 문서를 직접 확인하는 편이 안전하다. AFM 3 Core Advanced는 최상위 애플 실리콘에서만 풀린다는 전제가 붙어 있어 기기 커버리지가 제한적이다. 참고로 이 발표문을 둘러싸고 유통되는 제목 중에는 사용자 사적 데이터를 학습에 쓴다는 뉘앙스를 주는 표현도 있지만, 애플이 공개한 글은 사용자 데이터와 상호작용을 학습에 쓰지 않는다고 정반대로 서술하고 있다.

관련 글