검색이 기기 안으로 들어올 때, AI의 경쟁력은 ‘덜 보내는 능력’이다

김동현 기자 · 입력 2026.10.09 05:31
임베딩젬마2가 보여준 온디바이스 AI의 다음 과제
기사 대표 이미지
SimonWaldherr

구글의 ‘임베딩젬마2’에서 필자가 주목한 것은 7억4000만이라는 파라미터 수가 아니다. 더 중요한 변화는 사진과 음성을 이해하는 검색 기능이 클라우드가 아니라 개인의 기기 안으로 들어오고 있다는 점이다. 앞으로 좋은 AI는 무엇이든 서버로 보내는 AI가 아니라, 보내지 않고도 필요한 답을 찾아내는 AI여야 한다고 본다.

생성보다 먼저 필요한 것은 ‘잘 찾는 능력’

임베딩은 글·사진·소리의 의미를 숫자 좌표로 바꾸는 기술이다. 서로 의미가 비슷한 자료를 지도 위 가까운 곳에 놓는다고 생각하면 쉽다. 생성형 AI가 문장을 만들어내는 데 주목받아 왔다면, 임베딩 모델은 답의 근거가 될 자료를 제대로 찾는 역할을 맡는다. 개인 사진첩에서 “바닷가에서 아이가 웃는 영상”을 찾거나, 녹음 파일 속 특정 주제를 검색하는 기능도 이 토대 위에서 가능해진다.

그동안 멀티모달 AI, 즉 글뿐 아니라 이미지·음성·영상까지 함께 다루는 AI는 큰 연산 자원과 서버 연결을 요구하는 경우가 많았다. 임베딩젬마2는 100개 이상의 언어와 8192토큰 문맥을 지원하고, 필요한 인코더만 골라 실행하도록 설계됐다. 인코더는 사진이나 소리를 AI가 비교할 수 있는 숫자로 바꾸는 부품이다. 결과 벡터의 차원도 줄일 수 있어 저장 공간과 검색 비용을 조절할 여지가 생겼다. 이는 최고 성능 하나를 겨루기보다 기기의 조건에 맞춰 성능과 자원을 배분하려는 흐름으로 읽힌다.

작아졌다는 사실만으로 현장성이 보장되지는 않는다

온디바이스 처리는 민감한 가족사진, 회의 녹음, 의료·산업 현장 자료를 외부로 전송하지 않아도 된다는 점에서 반갑다. 통신이 불안정한 환경에서도 작동할 수 있고, 서비스 사업자가 모든 원본 데이터를 보관해야 할 이유도 줄어든다. 국내 기업에는 거대 모델을 처음부터 만드는 경쟁보다 제조 설비, 차량, 교육 단말, 기록 관리처럼 구체적인 문제에 이 모델을 결합할 기회가 더 현실적이다.

다만 작은 모델이라는 이유만으로 안전성과 품질이 저절로 확보되지는 않는다. 한국어 방언이나 전문용어, 소음이 섞인 음성, 오래된 저화질 사진에서도 검색 정확도가 유지되는지 별도 검증해야 한다. 임베딩 차원을 줄이면 저장 공간은 절약되지만 비슷한 자료를 구별하는 능력이 떨어질 수 있으므로, 제품마다 허용 가능한 오차를 측정해야 한다. 기기 안에서 처리한다는 홍보와 달리 색인이나 사용 기록이 서버로 전송된다면 개인정보 보호의 의미도 퇴색한다.

우리 산업이 준비할 것은 또 하나의 AI 기능 소개가 아니다. 한국어와 국내 현장 데이터에 맞춘 평가 기준, 기기별 속도·전력·정확도의 공개, 데이터가 어디에서 처리되는지 알리는 투명한 설계가 필요하다. 임베딩젬마2의 진짜 가능성은 AI를 더 크게 만드는 데 있지 않다. 필요한 정보는 더 잘 찾되, 사용자의 데이터는 덜 움직이게 만드는 데 있다.

저작권자 © 한국R&D신문 — 무단 전재 및 재배포 금지
김동현 기자 dh.kim@k-rnd.net
전자·AI·소프트웨어 — 전자회로·통신·임베디드, 생성형 AI·머신러닝·데이터
댓글 0 최신순 추천순

첫 댓글을 남겨보세요.

0 / 400 · 회원 로그인 시 닉네임으로 작성 · 비회원 수정은 작성 후 1분 이내