구글, 기기 안에서 이미지·음성까지 찾는 7.4억 파라미터 ‘임베딩젬마2’ 공개

김동현 기자 · 입력 2026.10.08 05:27
텍스트·코드·이미지·오디오·비디오를 하나의 768차원 공간에서 처리…모바일·엣지 환경에 맞춰 인코더 선택 실행
기사 대표 이미지
SimonWaldherr

문장으로 사진을 찾고, 음성 질문으로 영상 속 관련 구간을 찾아내는 인공지능 기능을 모바일 기기 안에서 구현할 수 있는 공개 모델이 나왔다. 구글은 2026년 10월 6일 텍스트뿐 아니라 코드·이미지·오디오·비디오를 함께 처리하는 온디바이스 멀티모달 임베딩 모델 ‘임베딩젬마2’를 공개했다.

임베딩은 문장이나 사진, 소리처럼 형태가 다른 데이터를 숫자 벡터로 바꾸는 기술이다. 쉽게 말하면 데이터의 의미와 특징을 숫자로 된 좌표에 표시하는 방식이다. 의미가 비슷한 자료는 가까운 좌표에 놓이기 때문에 검색·추천·분류·군집화에 활용할 수 있다. 생성형 인공지능이 외부 자료를 먼저 찾아 답변에 반영하는 검색증강생성, 즉 RAG에서도 관련 자료를 골라내는 검색 단계에 쓰인다.

임베딩젬마2는 서로 다른 형식의 입력을 같은 768차원 공간에 배치하도록 설계됐다. 이에 따라 음성을 문자로 바꾸거나 이미지에 설명문을 붙이는 별도 단계를 거치지 않고, 음성 질의와 영상 또는 텍스트와 이미지를 직접 비교하는 교차모달 검색을 구현할 수 있다. 전작이 텍스트 중심이었다면 이번 모델은 코드와 이미지, 비디오, 오디오, 여러 형식이 섞인 입력까지 처리 범위를 넓혔다.

전체 규모는 7억4000만 파라미터다. 파라미터는 모델이 학습 과정에서 조정한 값으로, 모델의 규모를 나타내는 지표다. 구성은 텍스트 모델 2억7000만개, 비전 인코더 1억7000만개, 오디오 인코더 3억개다. 텍스트 모델은 다시 백본 1억3000만개와 임베더 1억4000만개로 나뉜다. 모든 부분을 항상 실행할 필요는 없다. 텍스트만 처리할 때는 2억7000만개, 텍스트와 비전은 4억4000만개, 텍스트와 오디오는 5억7000만개 규모로 필요한 인코더만 선택할 수 있다.

모델은 100개 이상의 언어와 8192토큰 문맥을 지원한다. 토큰은 인공지능이 글을 읽을 때 나누는 기본 단위다. 기본 설정에서는 오디오 약 327초, 이미지 약 29장, 비디오 약 58프레임까지 처리한다. 출력 벡터는 기본 768차원이지만 마트료시카 표현 학습을 적용해 512·256·128차원으로 줄일 수 있다. 128차원을 사용하면 768차원과 비교해 저장 공간을 최대 6분의 1로 낮출 수 있어, 저장 용량이 제한된 모바일과 엣지 기기에 유리하다.

구글이 공개한 자체 평가에서 코드 임베딩 성능을 재는 MTEB Code 점수는 전작의 68.76에서 78.68로 9.92점 올랐다. 다국어 MTEB는 61.36, 이미지 임베딩 평가인 MIEB Lite는 64.64, 멀티모달 평가 MMEB v2 전체 점수는 59.01, 음성 검색 평가 MSEB 검색 점수는 69.54를 기록했다. 양자화 모델을 Pixel 11 Pro에서 시험한 결과 활성 메모리는 텍스트 전용 약 191MB, 전체 멀티모달 약 567MB로 측정됐다. 이 수치는 구글 자체 평가 결과다.

구글은 원본 데이터를 서버로 보내지 않고 기기 안에서 임베딩을 만들면 오프라인 검색을 구현할 수 있다고 설명했다. 임베딩젬마2는 젬마4 아키텍처를 기반으로 하며, 젬마4와 텍스트 토크나이저와 오디오 인코더 구조를 공유한다. 두 모델을 온디바이스 RAG에 함께 사용할 때 겹치는 구성 요소를 활용해 합산 메모리를 줄이려는 설계다. 모델은 아파치 2.0 라이선스로 공개돼 개발자가 모바일과 엣지 환경의 검색·추천 기능에 활용할 수 있다.

자료: Google DeepMind, Google AI for Developers, Google AI Edge, Google Developers

저작권자 © 한국R&D신문 — 무단 전재 및 재배포 금지
김동현 기자 dh.kim@k-rnd.net
전자·AI·소프트웨어 — 전자회로·통신·임베디드, 생성형 AI·머신러닝·데이터
댓글 0 최신순 추천순

첫 댓글을 남겨보세요.

0 / 400 · 회원 로그인 시 닉네임으로 작성 · 비회원 수정은 작성 후 1분 이내