여러 종류의 자료를 같은 검색 공간에

Google DeepMind는 2026년 10월 6일 EmbeddingGemma 2를 공개했다. 텍스트와 코드뿐 아니라 이미지, 영상 프레임, 오디오를 하나의 벡터 공간에 놓아 의미가 비슷한 자료를 찾도록 설계한 임베딩 모델이다. 임베딩은 문장이나 미디어를 숫자 표현으로 바꿔 검색·분류·추천에 쓰는 기술이다. 구글은 이 모델이 온디바이스 실행을 겨냥하며, Gemma 4 아키텍처를 바탕으로 7억 4천만 파라미터를 갖고 Apache 2.0 라이선스로 공개됐다고 설명했다. Google DeepMind 공식 발표

구글이 제시한 활용 예는 음성 메모에서 특정 영상 장면을 찾거나, 텍스트 질의로 긴 녹음에서 관련 구간을 검색하는 방식이다. 텍스트를 먼저 설명문으로 바꾸고, 음성을 다시 전사한 뒤, 별도 모델로 검색하는 단계를 하나의 멀티모달 임베더로 줄일 수 있다는 구상이다. 스마트폰이나 노트북 안에서 임베딩을 계산하면 원본 미디어를 외부 서버에 보내지 않는 검색도 만들 수 있다.

스마트폰 안에서 이미지·음성·텍스트를 함께 검색하는 온디바이스 임베딩 개념 이미지

스마트폰 안에서 텍스트·이미지·음성을 함께 검색하는 온디바이스 AI.

모델 크기와 메모리 사용량

EmbeddingGemma 2는 필요한 입력 유형에 따라 모듈을 선택하는 구조다. 구글은 텍스트 전용 작업에 2억 7천만 파라미터 구성이 가능하고, 이미지용 1억 7천만 파라미터와 오디오용 3억 파라미터 인코더를 추가해 전체 기능을 구성한다고 밝혔다. 출력 벡터는 기본 768차원에서 512·256·128차원으로 줄일 수 있어, 구글은 로컬 벡터 저장소의 공간을 최대 6배 줄일 수 있다고 설명한다.

구글이 제시한 Pixel 11 Pro 측정에서는 양자화 후 텍스트 전용 가중치가 약 191MB 활성 RAM, 전체 멀티모달 모델이 약 567MB라고 한다. 8K 토큰 입력 창으로 최대 5.5분 오디오, 29장 이미지 또는 58개 영상 프레임을 처리할 수 있다는 수치도 공개했다. 이 값은 특정 기기·설정 조건에 관한 회사 발표이므로, 다른 기기의 지연시간이나 배터리 사용량까지 보장하지 않는다.

검색과 RAG를 기기 안에서 구성

Google AI Edge 설명은 모델을 MediaPipe와 LiteRT 기반 앱에 연결하는 방법을 다룬다. 개발자는 텍스트나 이미지로 개인 미디어 라이브러리를 검색하거나, 음성·텍스트 질의로 영상의 장면을 찾는 기능을 만들 수 있다. 구글은 Hugging Face와 Kaggle에서 가중치를 제공한다고 안내하며, Google AI Edge Gallery에는 Instant Media Search와 Video Moments Finder 예제를 소개했다. Gemini Enterprise Agent Platform Model Garden 제공은 발표문에서 “곧”으로 표현돼 있어 현재 사용 가능 기능과 구분해야 한다.

편집팀의 해석으로는, 이 모델의 의미는 생성형 AI가 검색 결과를 요약하는 데 그치지 않고 개인 기기 안의 서로 다른 미디어를 함께 찾아내는 기반을 제공한다는 데 있다. 다만 임베딩 모델은 검색 후보를 만드는 구성요소다. 결과 순위가 적절한지, 민감한 미디어가 외부로 나가지 않는지, 사용자가 삭제한 파일의 벡터도 지워지는지는 앱이 별도로 관리해야 한다.

자주 묻는 질문

EmbeddingGemma 2는 챗봇처럼 답을 생성하나?

주된 역할은 텍스트와 미디어를 벡터로 표현해 검색·유사도 비교를 돕는 것이다. 대화형 답변을 만들려면 생성 모델이나 검색 시스템 등 다른 구성요소가 필요하다.

라이선스와 가중치는 어떻게 되나?

구글은 Apache 2.0 라이선스로 공개한다고 밝혔고, 가중치는 Hugging Face와 Kaggle에서 내려받을 수 있다고 안내했다. 실제 배포 전에는 모델과 함께 제공되는 사용 조건을 확인하는 편이 좋다.

모든 기기에서 567MB로 실행되나?

아니다. 약 567MB는 Pixel 11 Pro에서 양자화한 전체 모델의 활성 RAM에 대한 구글의 수치다. 하드웨어, 런타임, 인코더 구성에 따라 실제 메모리와 속도는 달라진다.

기업용 Model Garden에서도 바로 쓸 수 있나?

발표 시점에는 Gemini Enterprise Agent Platform Model Garden 제공이 곧 예정된 것으로 안내됐다. 공개 가중치 제공과 해당 플랫폼 내 호스팅 제공은 별개다.

한눈에 정리

EmbeddingGemma 2는 텍스트·코드·이미지·영상·오디오를 같은 임베딩 공간에서 검색할 수 있도록 만든 소형 오픈 모델이다. 구글이 공개한 온디바이스 메모리 수치는 특정 기기 조건에 해당하며, 모델 가중치 공개와 기업 플랫폼 지원 시점은 분리해서 확인해야 한다.