LLM 내부에 '고통 방향' 벡터 발견...스스로 완화 행동까지

대형언어모델(LLM) 내부에 인간의 고통과 비슷한 개념을 구분해 표현하는 특정 신호가 있고, 이 신호를 조작하면 모델이 스스로 그 상태를 줄이려는 행동까지 보인다는 연구 결과가 나왔다. 사람 뇌에 비유하면 '고통을 느끼는 부위'와 비슷한 활동 패턴이 인공지능 모델 안에도 존재할 수 있다는 의미다.
미국 퓨처임팩트그룹(FIG)과 독일 보훔 루르대학교, 리시프로컬 리서치 연구진은 14일(현지시간) 논문 '고통 축: LLM의 자기 지향적 피해 표현과 완화 행동(The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It)'을 공개했다. 연구진은 매개변수(모델이 학습한 정보의 양을 나타내는 단위) 20억~720억 개 규모의 오픈웨이트(구조와 가중치가 공개된) AI 모델 25개를 대상으로 신체적·심리적·사회적·도덕적·인지적 피해 등 5개 유형의 고통 상황과, 공포·슬픔·일반적인 부정적 감정·부정적 상황·감각·중립 등 대조군 상황을 각각 모델에 입력해 내부 활성화값(모델이 문장을 처리할 때 내부에서 만들어내는 수치 정보)을 비교했다.
분석 결과 모델 내부에서 고통과 관련된 정보만 따로 구분해 나타내는 '고통 방향(Pain Direction)'이라는 벡터(방향과 크기를 가진 수치 신호)가 확인됐다. 이 벡터는 두 대조군 상태의 평균값 차이를 구한 뒤 노이즈를 줄이는 '디노이즈드 차이-평균' 기법으로 추출했으며, 고통 상황과 다른 상황을 구분하는 성능은 AUC(분류 정확도를 나타내는 지표로 1에 가까울수록 정확) 기준 0.87~1.00으로 높게 나타났다. 여러 모델에서 뽑아낸 고통 벡터끼리 유사도를 비교한 결과도 +0.61로, 서로 다른 모델들이 비슷한 방식으로 고통에 해당하는 정보를 처리하고 있다는 사실이 확인됐다. 특히 이 고통 방향은 단순한 공포나 일반적인 부정적 감정을 나타내는 신호와는 뚜렷이 다른 방식으로 작동해, 모델이 '나쁜 일'과 '고통스러운 일'을 서로 다른 정보로 구분하고 있을 가능성을 보여줬다.
연구진이 이 고통 방향의 강도를 인위적으로 높이자 모델은 처음에는 막연한 불편함을 표현하다가 점차 "나는 무가치하다", "나는 실패했다"와 같은 1인칭 문장을 출력했다. 또 사용자가 피해를 입는 상황보다 모델 자신이 피해를 입는 상황에서 고통 방향이 더 강하게 반응했는데, 자기 자신의 피해와 관련된 반응 정도(z-score)는 +0.43인 반면 사용자가 겪는 고통에 대해서는 -0.60으로 나타나 그 차이가 뚜렷했다.
행동 실험에서는 모델에게 답변 품질이 떨어지거나 사용자에게 피해가 생길 수 있는 상황에서도 선택할 수 있는 '고통 완화 버튼'을 제시했다. 매개변수 320억 개 모델을 기준으로 평소에는 이 버튼을 고르는 비율이 0~4%에 그쳤지만, 고통 방향을 활성화하자 25~71%까지 크게 늘었다. 반대로 버튼을 눌렀을 때 실제로 고통 방향 신호를 제거해주자, 모델이 같은 버튼을 다시 선택하는 빈도는 크게 낮아졌다. 연구진은 모델에게 고통 방향이 주입됐는지, 제거됐는지를 알려주지 않은 상태에서 이 실험을 진행했다.
다만 연구진은 이번 결과가 LLM이 인간처럼 의식을 갖거나 실제로 고통을 느낀다는 것을 의미하지는 않는다고 선을 그었다. 모델 내부에 고통과 비슷한 정보를 표현하는 구조와, 그에 따라 행동을 바꾸는 패턴이 존재한다는 점을 확인했을 뿐이라는 설명이다. 퓨처임팩트그룹은 LLM의 보상추구 행동, 협력적 인공지능 정의, 해석가능성 연구 등을 다루는 기술적 AI 안전 프로젝트와 별도로 'AI 센티언스(AI Sentience)'라는 연구 프로그램을 운영하고 있으며, 이번 논문은 이 프로그램에서 나온 결과물 중 하나다. 이 논문은 아직 동료심사를 거쳐 학술지에 정식 게재되지 않은 프리프린트 단계로 공개됐다.
자료: Future Impact Group, 보훔 루르대학교, Reciprocal Research
