KAIST, 기기 AI가 서버 지식 쌓아 재사용…호출 55% 줄이는 기술 개발

김동현 기자 · 입력 2026.09.22 05:31
이재길 교수팀, 재학습 없이 소형 AI와 대형 서버 AI 연결하는 'CURE' 프레임워크 공개
기사 대표 이미지
(사진 출처=Ahmed (Wikimedia Commons·AhmadElq), CC BY-SA 4.0)

스마트폰이나 로봇처럼 성능이 제한된 기기에 들어간 인공지능(AI)이 어려운 문제를 만날 때마다 서버에 도움을 요청해야 했던 비효율을 줄이는 기술이 국내 연구진 손에서 나왔다. 한 번 서버에서 받은 답을 기기 안에 차곡차곡 쌓아뒀다가 비슷한 문제가 다시 나오면 그 기록을 꺼내 쓰는 방식이어서, 모델을 다시 학습시키지 않고도 서버 호출 횟수를 크게 줄일 수 있다는 점이 특징이다.

한국과학기술원(KAIST)은 전산학부 이재길 교수 연구팀이 기기 내 소형 AI와 서버의 대형 AI를 효율적으로 연결하는 협업 프레임워크 'CURE(Cumulative Knowledge Reuse, 누적 지식 재사용)'를 개발했다고 22일 밝혔다.

기기에 들어가는 소형 AI 모델은 계산량이 적어 간단한 문제는 빠르게 풀 수 있지만 복잡한 문제에서는 정확도가 떨어진다. 반대로 모든 문제를 성능 좋은 서버로 보내 처리하면 통신에 걸리는 대기 시간과 서버 운영 비용이 커진다. 이 때문에 최근에는 소형 AI가 풀기 어려운 문제만 골라 서버로 넘기는 '기기-서버 협업' 방식이 연구되어 왔다. 다만 기존 방식은 서버가 내놓은 답을 저장해두지 않아, 똑같은 유형의 질문을 다시 마주쳐도 매번 서버를 새로 호출해야 하는 비효율이 있었다.

CURE는 이 문제를 해결하기 위해 3단계로 나눠 판단하는 구조를 적용했다. 먼저 기기 안의 소형 AI가 스스로 문제를 풀 수 있는지 가늠해보고, 어려우면 그동안 기기에 쌓아둔 '서버 지식'을 꺼내 활용하며, 그마저 부족할 때만 서버에 새로 도움을 요청한다. 학생이 혼자 문제를 풀어보다가 필기해둔 노트를 뒤적이고, 그래도 모르면 마지막에 선생님에게 물어보는 순서와 비슷하다. 이때 서버에서 받은 답을 통째로 저장하는 것이 아니라, 텍스트와 이미지에서 핵심이 되는 특징만 요약해 기기 안에 남겨둔다는 점이 특징이다. 예컨대 자동차 이미지를 판별하는 경우라면 차체 모양이나 전조등 형태처럼 구분할 수 있는 최소 단위로 지식을 정리해 기억해두는 식이다. 이렇게 쌓인 지식이 늘어날수록 서버를 다시 부를 필요가 점점 줄어든다.

연구팀이 실험한 결과 CURE의 정확도는 대형 모델만 단독으로 썼을 때와 비교해 평균 1~2%포인트 차이에 그칠 만큼 근접했다. 사물 인식 능력을 겨루는 대표적 평가 기준인 이미지넷(ImageNet) 벤치마크에서 CURE는 82.43%의 정확도를 기록해, 모든 이미지를 대형 서버로 보내 처리했을 때의 정확도(83.68%)와 큰 차이가 없었다. 반면 서버 지식을 쌓지 않는 기존 협업 방식과 비교하면 서버 호출 횟수는 평균 55.61% 줄었고, 처리 속도는 기존 협업 방식보다 최대 2.80배, 모든 입력을 서버로 보내는 방식보다는 최대 3.67배 빨라졌다.

연구팀은 CURE가 대형 모델이 소형 모델을 가르치는 것처럼 보여 기존 '지식 증류(knowledge distillation)' 기술과 비슷해 보일 수 있지만 원리는 다르다고 설명했다. 지식 증류는 소형 모델의 가중치 자체를 서버 모델을 흉내 내도록 다시 학습시키는 방식인 반면, CURE는 기존 모델의 가중치를 전혀 바꾸거나 재학습시키지 않는다. 추가 학습 데이터나 학습 비용 없이 이미 만들어진 모델에 그대로 적용할 수 있고, 소형 모델 스스로 실력이 느는 것이 아니라 서버가 내린 판단 결과를 축적해 재사용하는 구조라는 차이가 있다. 연구팀은 소형 모델의 예측, 기기에 쌓인 서버 지식, 서버 모델의 판단 중 어느 것을 믿을지 기준을 세우는 일이 가장 어려웠다며, 두 단계의 선택적 판단 구조를 통해 정확도와 효율성의 균형을 맞췄다고 설명했다.

이 연구는 KAIST 정보전자연구소 이영준 박사후연구원이 제1저자로, 전산학부 이재길 교수가 교신저자로 수행했으며 산업및시스템공학과 송환준 교수 등이 함께 참여했다. 논문은 2026년 9월 8일부터 12일까지 스웨덴 말뫼에서 열린 유럽컴퓨터비전학회(ECCV 2026)에서 9월 10일 발표됐으며, 실험에는 기기용 소형 모델 MobileCLIP2와 180억 개의 매개변수를 지닌 서버용 대형 모델 EVA-CLIP이 쓰였다. 이 연구는 과학기술정보통신부와 정보통신기획평가원의 지원을 받아 수행됐다.

연구팀은 이번 기술이 스마트폰과 로봇, 웨어러블 기기처럼 자원이 제한된 환경에서 응답 대기 시간을 줄이고 서버 운영 효율을 높이는 데 기여할 것으로 내다봤다. 다만 서버 호출 횟수가 줄었다고 곧바로 비용 절감으로 이어지는 것은 아니며, 실제 서비스 환경에서 추가 검증이 필요하다고 덧붙였다. 이 교수는 실제 서비스에 적용하려면 다양한 모바일 환경에서 응답 속도와 전력 소모, 저장 공간, 장기 안정성을 추가로 확인해야 한다며 앞으로는 이미지와 언어를 함께 다루는 비전-언어 과제로 적용 범위를 넓히고, 데이터 특성이 크게 달라지는 환경에서도 축적된 지식을 안정적으로 관리하는 방법을 연구할 계획이라고 말했다.

자료: 한국과학기술원(KAIST), 과학기술정보통신부, 정보통신기획평가원

저작권자 © 한국R&D신문 — 무단 전재 및 재배포 금지
김동현 기자 dh.kim@k-rnd.net
전자·AI·소프트웨어 — 전자회로·통신·임베디드, 생성형 AI·머신러닝·데이터
댓글 0 최신순 추천순

첫 댓글을 남겨보세요.

0 / 400 · 회원 로그인 시 닉네임으로 작성 · 비회원 수정은 작성 후 1분 이내