[기획] 이야기 속 단어에 ‘좌표’를 매기는 해마…GPT-2와 닮은 의미의 거리

손창한 기자 · 입력 2026.10.07 19:39
356개 신경 단위의 합주로 문맥을 표현…닮았다는 것은 같은 알고리즘이라는 뜻이 아니다
기사 대표 이미지
National Institutes of Health

누군가 이야기 속에서 영어 단어 ‘bank’를 말했다고 해보자. 은행을 말하는지 강둑을 말하는지는 철자가 아니라 앞뒤 문장이 정한다. 사람의 뇌도 같은 단어에 늘 같은 표식을 붙이는 대신, 이야기의 흐름에 따라 서로 다른 활동 패턴을 만들 수 있다는 연구 결과가 나왔다. 단어 하나를 뉴런 하나가 맡는 사전이라기보다 여러 연주자가 저마다 다른 세기로 소리를 내고, 그 화음 전체로 뜻과 문맥을 구별하는 모습에 가까웠다.

멜리사 프랜치 연구진은 임상 목적으로 뇌에 전극을 삽입한 뇌전증 환자 10명이 자연스러운 영어 이야기를 듣는 동안 해마의 단일·다중 신경 단위 활동을 기록했다. 분석에는 356개 신경 단위와 단어 발생 7,346건이 쓰였다. 여기서 356개는 사람 수도, 모두 개별 뉴런이라는 뜻도 아니다. 단일 뉴런과 여러 뉴런의 신호가 섞인 멀티유닛을 함께 센 기록 단위다. 연구 결과는 2026년 9월 30일 발표됐으며, 10월 6일 나온 정정은 연구 결과가 아니라 최초 게재판의 저자 순서를 바로잡은 것이었다.

해마 속 장소가 아닌 ‘356차원 수학 지도’

연구에서 말하는 단어의 ‘좌표’ 또는 ‘지도’는 해마의 실제 위치가 아니라 신경 집단 활동으로 만든 고차원 수학 공간이다. 단어가 등장한 뒤 356개 신경 단위가 얼마나 발화했는지를 각각 하나의 축으로 삼으면, 한 번의 단어 발생은 356개 값을 가진 점 하나로 나타낼 수 있다. 일상적인 지도에서는 가로와 세로 두 축으로 위치를 표시하지만, 이 분석에서는 눈으로 직접 그리기 어려운 356차원 공간에 활동 패턴을 놓은 셈이다.

핵심은 점 하나의 위치보다 점들 사이의 거리다. 비슷한 뜻과 문맥에서 나온 단어들의 신경 활동 패턴이 가까운지, 의미가 다른 단어들은 멀어지는지를 비교하면 해마 집단 활동에 담긴 관계 구조를 살펴볼 수 있다. 개별 뉴런은 단어 하나나 의미 범주 하나만 전담하지 않았다. 서로 다른 여러 단어와 범주에 복합적으로 반응했고, 의미는 개별 세포보다 신경 집단에 분산된 활동 패턴에서 더 분명하게 드러났다.

연구진은 음소, 문법·품사, 단어 길이와 발화시간 같은 영향을 통제한 뒤에도 의미 임베딩이 신경 활동을 예측했다고 보고했다. 임베딩은 단어를 여러 숫자로 나타내 의미 관계를 계산할 수 있게 만든 표현이다. 지하철 노선도가 실제 도시와 같은 물체는 아니지만 역 사이의 관계를 보여주듯, 신경 임베딩도 해마의 물리적 배치를 그린 그림이 아니라 활동 사이의 관계를 나타낸다.

고정된 사전보다 이야기의 흐름에 가까웠다

연구진은 신경 활동의 거리 구조를 Word2Vec, BERT, GPT-2의 의미 임베딩과 비교했다. Word2Vec은 단어에 비교적 고정된 벡터를 부여하는 정적 임베딩이고, BERT와 GPT-2는 앞뒤 문맥에 따라 같은 단어도 다르게 표현하는 문맥형 임베딩이다. 연구진이 비교한 모델과 층 가운데 GPT-2 37층 표현이 신경 활동과 가장 가까운 정렬을 보였다. BERT에서는 13층 표현이 대표 비교 대상으로 쓰였다.

같은 표면 단어가 이야기 속에서 반복돼도 문맥이 달라지면 해마의 신경 활동 패턴 역시 달라졌다. GPT-2로 계산한 단어의 다의성, 즉 한 단어가 문맥에 따라 여러 뜻으로 쓰이는 정도가 클수록 반복된 단어에 대한 신경 패턴의 변동도 컸다. 둘 사이의 상관은 r=0.4829였고 P값은 1.36×10⁻²⁴였다. 이는 문맥에 따라 의미가 크게 움직이는 단어일수록 해마 집단 반응도 더 달라지는 경향을 보였다는 뜻이다.

다만 ‘GPT-2와 닮았다’는 표현의 크기를 정확히 읽어야 한다. 전체 356개 신경 단위를 이용한 의미거리와 신경거리의 대표 상관은 r=0.0932였고, 95% 신뢰구간은 0.0928~0.0935였다. 0이 아닐 가능성을 정밀하게 포착했더라도 상관 자체는 작다. 통계적으로 분명한 경향과 두 체계가 거의 같다는 주장은 전혀 다른 이야기다.

의미 임베딩으로 잔차 활동이 유의하게 예측된 92개 신경 단위를 미리 선별한 특정 확장분석에서는 GPT-2 37층과의 거리 상관이 r=0.895로 나타났다. 그러나 이는 전체 집단의 대표 결과가 아니다. 선택 기준과 평가의 독립성, 같은 단어와 신경 자료를 반복해서 공유하는 단어 쌍들의 의존성을 고려해야 한다. 따라서 이 수치를 ‘뇌와 GPT-2가 89.5% 일치했다’고 바꿔 말할 수 없고, 92개를 의미만 담당하는 전용 뉴런으로 볼 수도 없다.

너무 비슷한 뜻은 오히려 멀리 벌어졌다

거리 관계는 모든 구간에서 한 방향으로 움직이지 않았다. GPT-2의 의미거리가 0.14~0.40인, 의미가 매우 가까운 범위에서는 단어의 의미가 가까울수록 신경 거리가 오히려 멀어지는 역상관이 나타났다. 연구진은 비슷한 의미를 잡음 속에서도 구별하기 위한 ‘대조 부호화’ 가능성을 제안했다. 시끄러운 곳에서 비슷한 이름을 구별하려고 발음을 더 또렷하게 하는 것처럼, 혼동하기 쉬운 의미 사이에 신경 공간의 안전거리를 둘 수 있다는 해석이다.

그러나 대조 부호화는 직접 입증된 기제가 아니라 연구진이 제안한 가설이다. 이번 연구는 특정 신경 단위를 자극하거나 억제해 단어 이해가 변하는지를 시험하지 않았다. 관찰된 활동이 의미 이해의 원인인지, 이해 과정에서 뒤따라 나타난 결과인지도 구분할 수 없다.

뇌가 GPT-2라는 결론은 아니다

이번 결과가 보여준 것은 해마와 GPT-2의 표현기하학, 즉 항목들 사이의 거리 관계 일부가 닮았다는 점이다. 해마가 트랜스포머 구조를 갖췄다거나 GPT-2의 다음 토큰 예측 알고리즘으로 작동한다는 증거는 아니다. 서로 전혀 다른 두 시스템이 같은 언어 입력의 통계적 구조에 민감해 비슷한 거리 관계를 만들었을 가능성도 있다. 비교 결과 역시 Word2Vec·BERT·GPT-2와 연구진이 선택한 층, 거리척도, 분석법 안에서 성립한다. 가능한 모든 언어모델 가운데 GPT-2가 사람 뇌와 가장 닮았다는 뜻은 아니다.

일반화에도 신중해야 한다. 참가자는 건강한 일반인이 아니라 난치성 뇌전증 환자 10명이었다. 질환과 약물, 발작 병소와 전극 위치의 영향을 완전히 배제할 수 없으며, 여러 환자와 세션에서 모은 356개 신경 단위는 한 사람의 해마에서 동시에 기록한 자료와 같지 않다. 기록 위치도 인간 해마 전체 가운데 임상적으로 접근할 수 있는 일부에 치우쳤다. 해마는 넓은 피질 언어망의 한 부분이므로, 이번 결과만으로 해마가 의미를 전담하거나 단어 뜻을 독점적으로 저장한다고 할 수 없다.

연구는 영어 이야기를 듣는 한 조건에서 이뤄졌다. 읽기와 대화, 단독 단어, 다른 언어에서도 같은 구조가 나타나는지는 확인되지 않았다. 특히 조사·어미와 형태소 구조, 어순이 영어와 다른 한국어에는 바로 일반화할 수 없다. 한국어 이야기와 한국어 말뭉치로 학습한 모델을 사용해 사람 해마의 단일뉴런 활동을 직접 비교한 동료심사 연구도 확인되지 않았다.

연구진은 데이터와 분석 코드를 공개해 독립 검증의 기반을 마련했다. 데이터는 미국 BRAIN Initiative Data Archive의 DABI 프로젝트 W2ZHP46ITR2D에, 본문 그림 1~4와 확장자료 그림 1~10의 분석 코드는 저자 저장소에 공개됐다고 논문은 밝혔다. 다만 공개됐다는 사실은 이미 독립적으로 재현됐다는 뜻이 아니다. 이번 연구가 그린 것은 완성된 ‘해마 의미 지도’가 아니라, 사람이 문맥 속 뜻을 다룰 때 여러 신경 단위의 합주가 수학적 거리 구조를 이룰 수 있다는 하나의 단서다.

자료: 베일러의과대학·라이스대학교·캘리포니아대학교 버클리·텍사스아동병원·미국 국립의학도서관·미국 BRAIN Initiative Data Archive

저작권자 © 한국R&D신문 — 무단 전재 및 재배포 금지
손창한 기자 ch.son@k-rnd.net
화학·물리·의학·생명 — 신소재·촉매·양자·물성, 의학·제약·바이오
댓글 0 최신순 추천순

첫 댓글을 남겨보세요.

0 / 400 · 회원 로그인 시 닉네임으로 작성 · 비회원 수정은 작성 후 1분 이내