구글이 온디바이스 멀티모달 임베딩 모델 EmbeddingGemma 2를 공개

Hacker News3일 전

구글 딥마인드가 온디바이스 환경을 겨냥한 오픈 임베딩 모델 EmbeddingGemma 2를 공개했다. 740M 파라미터 규모로, 텍스트뿐 아니라 코드·이미지·오디오·비디오를 하나의 벡터 공간에 매핑하는 네이티브 멀티모달 모델이다. Gemma 4 아키텍처를 기반으로 만들어졌고 Apache 2.0 라이선스로 배포돼 상업적 사용이 가능하다.

구조에서 눈에 띄는 건 모듈화다. 텍스트만 다룰 때는 270M 파라미터로 줄여 쓸 수 있고, 비전 인코더 170M과 오디오 인코더 300M를 선택적으로 얹어 전체 멀티모달 기능을 구성하는 방식이다. 필요한 만큼만 올려 쓰라는 설계다.

저장 공간도 유연하다. Matryoshka Representation Learning(MRL)을 적용해 출력 벡터를 768차원에서 512·256·128차원으로 잘라 쓸 수 있다. 로컬 벡터 데이터베이스 기준으로 최대 6배까지 저장량과 메모리 사용을 줄일 수 있다는 설명이다.

메모리 요구량은 양자화를 적용한 구글 픽셀 11 프로에서 텍스트 전용 가중치가 약 191MB, 전체 멀티모달 모델이 약 567MB 수준이다. 컨텍스트 창은 8K 토큰으로 전작 대비 4배 넓어졌고, 한 번에 오디오 5.5분, 이미지 29장, 비디오 58프레임 또는 이들이 섞인 입력을 로컬 하드웨어에서 처리할 수 있다.

성능 지표도 함께 제시됐다. MTEB Code 점수는 68.76에서 78.68로 9.92포인트 올랐고, MAEB(Massive Audio Embedding Benchmark)를 포함한 벤치마크에서 10억 파라미터 미만 멀티모달 임베딩 모델 중 최상위권을 기록했다. 텍스트·비전·오디오 전반에서 자기보다 두 배 이상 큰 전문 모델을 앞서는 항목도 있다고 한다. 다국어 텍스트 성능은 1세대 수준을 유지했다.

배경에는 1세대의 성과가 있다. 작년에 나온 EmbeddingGemma는 경량 텍스트 임베딩 옵션으로 2000만 회 이상 다운로드되며 온디바이스 검색과 프라이버시 우선 RAG 파이프라인에 쓰였다. 2세대는 여기서 텍스트 경계를 넘어 코드·이미지·비디오·오디오까지 포괄하는 쪽으로 방향을 잡았다. Gemini Embedding 모델과 같은 기술 계통이다.

실무에서 달라지는 지점은 배포 경로다. 가중치는 Hugging Face와 Kaggle에서 받을 수 있고, Gemini Enterprise Agent Platform Model Garden 지원도 예정돼 있다. 온디바이스 쪽은 MediaPipe로 임베딩·검색·결정 태스크를 바로 붙이거나 LiteRT로 커스텀 통합을 만들 수 있으며, 브라우저에서는 transformers.js나 WebGPU를 쓴다. 서빙은 transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama, LMStudio 등과 맞물리고, 벡터 저장은 Qdrant, 파인튜닝은 Unsloth 가이드를 따르면 된다.

활용 예시도 공개됐다. Google AI Edge Gallery의 Instant Media Search에서 텍스트나 이미지로 미디어 라이브러리를 의미 검색할 수 있고, Video Moments Finder는 텍스트·오디오 질의로 영상 속 특정 순간을 찾아낸다. Foresight 앱은 EmbeddingGemma 2의 로컬 파일 검색과 Gemma 4의 문맥 추론을 조합한다. MediaPipe Decision Task API를 쓰면 멀티모달 문맥 기반 분류·라우팅·예측 엔진도 만들 수 있다. Gemma 4와 텍스트 토크나이저 및 오디오 인코더를 공유하기 때문에 두 모델을 한 파이프라인에 올릴 때 전체 메모리 부담이 줄어든다.

주의할 점은 수치의 전제다. 메모리 사용량은 양자화를 적용한 픽셀 11 프로 측정값이라 다른 하드웨어나 정밀도에서는 달라진다. 270M·170M·300M 같은 파라미터 수는 선택적 인코더를 포함하느냐에 따라 구성이 갈리는 값이고, 전체 평가 지표는 모델 카드에서 확인해야 한다. Model Garden 등록은 아직 예정 단계다.