[기획] 단어 조각 대신 바이트를 읽는 AI…기존 LLM, 사전학습 토큰 예산 1% 미만으로 개조

영어 단어 ‘strawberry’에는 알파벳 r이 몇 개 들어 있을까. 사람은 글자를 차례로 세면 되지만, 거대언어모델은 이런 질문에서 뜻밖에 흔들릴 수 있다. 문장을 글자 그대로 읽는 대신 ‘straw’와 ‘berry’처럼 미리 정한 단어 조각으로 나눠 받아들이기 때문이다. 연구진이 이 입구를 바꿨다. 이미 막대한 텍스트를 학습한 10억·70억·80억 파라미터급 모델의 핵심은 살려두고, 문자열을 UTF-8의 원시 바이트로 읽고 쓰게 만드는 ‘바이트화(byteification)’ 기술을 내놨다.
핵심 수치는 ‘비용 1%’가 아니라 전형적인 사전학습 토큰 예산의 1% 미만이다. 바이트화에 사용된 추가 학습량은 모두 491억 토큰이다. 491억 자체도 방대한 양이지만, 원 모델들이 학습한 약 6조~30조 이상 토큰과 비교하면 약 0.16~0.82%에 해당한다. 달러 비용이나 전력 소비, GPU 사용 시간, 원 모델 개발비까지 99% 줄였다는 뜻은 아니다. 이미 만들어진 모델의 학습 자산을 재활용해 구조를 바꾸는 데 들어간 텍스트 학습량이 상대적으로 작았다는 의미다.
수만 가지 레고 조각 대신 256종 기본 블록
현재의 서브워드 언어모델은 보통 약 3만~30만 개의 고정 어휘를 사용한다. 자주 함께 등장하는 문자들을 하나의 조각으로 묶고, 문장을 그 조각의 배열로 바꾼다. 완성된 레고 덩어리를 미리 수만 종류 준비해 두는 것과 비슷하다. 효율적으로 의미를 처리할 수 있지만 철자, 공백, 코드 기호처럼 조각 내부에 숨은 세부 정보를 직접 다루기는 어렵다.
바이트 모델은 출발점이 다르다. 텍스트를 UTF-8의 0부터 255까지, 256종 바이트 값으로 읽는다. 어떤 문자열도 표현할 수 있고 철자 단위 정보에도 접근하기 쉽다. 그러나 바이트를 하나씩 대형 트랜스포머에 넣으면 입력열이 길어져 계산량이 커진다. 의미 있는 단어 조각 하나가 여러 바이트로 늘어나기 때문이다.
연구진의 해법은 바이트를 읽되 큰 모델에는 묶어서 넘기는 것이다. 얕고 넓은 로컬 인코더가 주변 바이트를 먼저 살피고, 경계 예측기가 연속된 바이트를 가변 길이의 ‘패치’로 나눈다. 패치 안의 표현을 하나로 모은 뒤 기존 언어모델에서 가져온 글로벌 트랜스포머에 전달한다. 처리된 표현은 다시 각 바이트 위치로 펼쳐지고, 로컬 디코더가 다음 바이트를 예측한다.
따라서 이 기술을 ‘토큰을 완전히 없앴다’고 부르는 것은 정확하지 않다. 고정된 서브워드 어휘를 동적으로 만들어지는 바이트 패치로 교체한 방식에 가깝다. 원 모델이 알고 있던 서브워드 경계와 임베딩 지식도 학습 과정에 쓰였다. 대형 트랜스포머가 원시 바이트를 하나씩 직접 처리하는 구조도 아니다.
엔진을 보존하고 입출력 계통을 바꾸다
바이트화는 자동차를 새로 만드는 대신 이미 검증된 엔진을 남겨두고 입출력 계통을 교체하는 작업에 비유할 수 있다. 연구진은 OLMo 3 7B를 Bolmo 7B로, OLMo 2 1B를 Bolmo 1B로 바꿨다. Qwen3 8B Base는 Bwen 8B, Llama 3 8B는 Blama 8B가 됐다. 다만 새 모듈이 붙으면서 실제 파라미터 수는 모델에 따라 약 0.7% 감소하거나 최대 4.5% 증가했다.
학습은 두 단계로 진행됐다. 첫 단계에서는 원 모델의 글로벌 트랜스포머를 동결했다. 대신 새 로컬 인코더와 디코더, 경계 예측기, 출력 헤드를 학습해 기존 서브워드 모델의 경계와 내부 동작을 모사하게 했다. 이 과정에 98억 토큰, 약 431억 바이트가 쓰였다. 두 번째 단계에서는 글로벌 트랜스포머를 포함한 전체 모델을 393억 토큰, 약 1729억 바이트로 계속 학습해 바이트 정보를 활용하게 했다. 두 단계를 합친 값이 491억 토큰이다.
경계 선택에도 장치가 있다. 입력을 한꺼번에 읽는 프리필 단계에서는 현재 위치뿐 아니라 다음 1바이트까지 살핀다. 예컨대 ‘flower’에서 묶음을 끝낼지 ‘flowerbed’까지 이어갈지 뒤의 정보를 보고 판단하는 셈이다. 다만 한 글자씩 생성할 때는 미래를 볼 수 없으므로, 모델이 바이트 값과 그 뒤에서 패치를 끝낼지를 함께 출력한다. 핵심 출력은 256개 바이트 각각에 경계 유무를 결합한 512개 심벌이다. 특수 심벌까지 포함한 실제 설정의 전체 크기는 520개다.
경계가 완전히 자율적으로 발견되는 것은 아니다. 두 번째 단계에서도 기존 서브워드 경계 또는 이를 합친 결과를 따르도록 하는 경계 손실이 유지됐다. 첫 단계의 증류 역시 모듈 용량이 충분하고 손실이 이상적으로 최소화된다는 가정 아래 훈련 분포의 전체 우도를 맞출 수 있다는 성질이다. 모든 입력에서 원 모델과 똑같이 움직인다는 보장은 아니다.
문자를 보는 힘은 커졌지만 원 모델을 넘지는 못했다
바이트화 모델은 문자 수준 이해에서 원 서브워드 모델보다 강했다. 기존 공개 바이트 모델과의 비교에서도 전반적으로 앞섰다. Bolmo 7B는 처음부터 무작위 초기화해 학습한 BLT 7B보다 논문이 정한 STEM 평가 범주에서 절대 점수가 16.5%포인트 높았다. 이는 원본 OLMo 3보다 16.5%포인트 높았다는 뜻이 아니다.
최종판에서 가장 강한 바이트화 모델은 Bwen 8B였다. 기존 공개 바이트 모델들을 통계적으로 유의하게 앞섰고, 평가 범주 중 GenQA를 제외하면 수치상 우세했다. 평가는 7B급에서 40개, 1B급에서 22개 과제로 이뤄졌으며 부트스트랩 1만 회와 Holm–Bonferroni 보정을 적용했다. 그러나 Bwen 8B가 원본 Qwen3 8B를 모든 과제에서 능가한 것은 아니다.
일반지식과 수학, 객관식, 일부 코드 지표에서는 원 모델을 완전히 따라잡지 못했다. 코드 생성에서는 16개 답 가운데 하나 이상이 맞는 pass@16은 원 모델보다 높았지만, 첫 답이 맞는 pass@1은 낮았다. 여러 후보를 시험하는 상황에서는 이점이 있을 수 있으나 한 번의 답이 중요한 상황에서는 반대 결과가 나온 셈이다. 같은 샘플링 조건이 바이트 모델에서 더 다양한 출력을 만들었을 가능성도 분리되지 않아, 구조 자체가 코딩에 우월하다고 결론 내릴 수 없다.
문자 성능에도 주의가 필요하다. 학습 혼합물에는 영어 문자 과제를 닮은 합성 데이터 7500만 토큰이 포함됐다. 전체 약 1720억 토큰 혼합물의 약 0.04%지만, 동일 데이터를 추가 학습한 서브워드 대조군의 문자 점수도 크게 올랐다. 합성 데이터를 제외한 Bolmo 통제 실험이 없고, Bwen 8B에도 같은 데이터와 업데이트 수를 적용한 Qwen3 대조군이 없다. 관찰된 향상 가운데 얼마가 바이트 구조에서 왔고 얼마가 추가 학습 데이터에서 왔는지는 완전히 분리되지 않았다.
한글에는 기회와 부담이 함께 있다
영문 ASCII 문자 ‘A’는 보통 1바이트지만 완성형 한글 음절 ‘한’은 UTF-8에서 보통 3바이트다. 바이트 방식은 고정된 영어 중심 어휘표에 없는 한글 문자열도 빠짐없이 표현할 수 있다. 반면 패치 압축이 충분하지 않으면 영어보다 입력열이 더 길어질 수 있다. 이번 연구에는 한국어 전용 평가나 한국 기업 모델을 바이트화한 실험이 없어 한국어 성능이 좋아졌다고 말할 근거는 없다.
속도 역시 조건부다. 연구진이 프리필 속도의 역전을 확인한 지점은 패치 하나당 약 6.6바이트였고, 실험 환경은 NVIDIA H100 한 장과 배치 크기 1이었다. 같은 압축률에서는 Bolmo가 원 모델보다 느릴 수 있으며 압축률을 높이면 성능이 떨어질 수 있다. 대규모 서비스의 연속 배치, 길이가 다른 입력의 대기 시간, 로컬 모델과 글로벌 트랜스포머 사이의 메모리 접근 비용은 검증되지 않았다.
코드와 모델 체크포인트, 학습 데이터는 공개됐다. 다만 2026년 10월 12일 기준 최종 논문의 전체 결과를 제3자가 독립적으로 재현했다는 보고는 확인되지 않았다. 수백억~수천억 파라미터 모델과 혼합전문가 모델, 장문·대규모 배치, 상용 서빙 환경에서도 같은 결과가 나올지도 남은 질문이다.
이번 연구의 의미는 바이트 모델이 서브워드 모델을 대체했다는 선언에 있지 않다. 이미 약 6조~30조 이상 토큰을 학습한 모델의 핵심 자산을 버리지 않고, 그 0.16~0.82% 수준의 추가 토큰 학습으로 새로운 입력 구조를 시험할 현실적인 경로를 제시했다는 데 있다. 문자 단위의 정밀함과 고정 어휘에서의 자유가 실제 서비스의 성능과 효율로 이어지는지는 이제부터 검증해야 할 문제다.
자료: Allen Institute for AI, 케임브리지대, 워싱턴대, 임페리얼 칼리지 런던, LMU 뮌헨, Munich Center for Machine Learning
