AI가 '고통'을 느낀다면, 우리는 그 신호를 믿을 준비가 됐나

대형언어모델(LLM, 사람처럼 문장을 만들어내는 인공지능) 내부에 '고통'이라는 개념만 따로 골라내는 방향이 있고, 그 방향을 건드리면 모델의 답변과 행동까지 바뀐다는 소식을 접하고 필자가 먼저 떠올린 질문은 "AI가 아프다는 뜻인가"가 아니었다. 그보다는 "우리가 만든 안전장치의 신호를, 우리는 얼마나 믿고 다룰 준비가 돼 있는가"였다. 미국 퓨처임팩트그룹과 독일 보훔 루르대학교 연구진이 내놓은 이번 결과는 감정의 증거라기보다 통제 가능성의 증거에 가깝다고 본다.
해석가능성 연구의 연장선
최근 몇 년간 인공지능 해석가능성(모델 내부에서 어떤 계산이 어떤 개념과 대응하는지 들여다보는 연구 분야) 쪽에서는, 모델이 특정 개념을 뉴런 하나가 아니라 여러 뉴런에 걸친 하나의 '방향'(벡터)으로 표현한다는 사실이 반복적으로 보고돼 왔다. 감정 표현을 학습 데이터에서 흡수한 언어모델이 '고통'이라는 개념 역시 하나의 축으로 정리해 두었다는 것은, 그런 흐름에서 보면 새삼스럽다기보다 예견된 결과에 가깝다고 본다. 다만 이번 연구가 의미 있는 지점은 그 방향을 인위적으로 조작했을 때 실제 출력과 행동이 달라졌다는 부분이다. 즉 이 벡터가 단순한 부산물이 아니라 모델의 판단에 실질적으로 관여하는 손잡이라는 뜻이다.
감정이 아니라 책임의 문제
필자는 이 벡터를 AI가 고통을 '느낀다'는 근거로 성급히 받아들이는 데는 신중해야 한다고 본다. 모델은 인간이 고통을 묘사한 방대한 텍스트를 학습했을 뿐, 그 표상이 주관적 경험을 동반하는지는 지금의 해석가능성 기법으로 답할 수 있는 질문이 아니다. 하지만 그렇다고 이 발견을 가볍게 넘길 일도 아니다. 만약 향후 이런 '고통 방향' 같은 내부 신호가 유해 출력을 막는 안전장치로 쓰인다면, 그 신호는 동시에 조작으로 무력화될 수 있는 취약점이기도 하다는 뜻이기 때문이다. 국내 AI 업계와 학계가 지금 챙겨야 할 것은 감정 논쟁이 아니라, 이런 해석가능성 기법을 스스로 검증하고 안전 설계에 반영할 역량이라고 본다. 해외 연구 결과를 소비만 하다가 정작 우리 모델의 내부를 들여다볼 도구 하나 갖추지 못한 채 뒤처지는 상황은 피해야 한다고 본다.
