[기획] 논문 2900만 건을 ‘연구 이웃’으로…NIH가 펼친 과학 검증의 새 지도

논문 한 편을 골랐더니 그 주위를 49편의 ‘연구 이웃’이 둘러싼다. 빨간 노드는 철회된 논문이고, 금색 영역에는 여러 연구를 종합한 리뷰가 모여 있다. 노드 사이의 선을 따라가면 어떤 논문이 무엇을 인용했는지도 볼 수 있다. 미국 국립보건원(NIH)이 2026년 9월 24일 공개한 ‘Linked Discoveries’는 복잡한 문헌 검색을 ‘논문 한 편의 동네 지도’로 바꾸려는 초기 단계 실험 서비스다.
탐색의 출발점이 되는 논문, 즉 ‘시드’를 한 채의 집이라고 생각하면 이해하기 쉽다. 가장 가까운 이웃 49채가 먼저 나타나 시드를 포함한 50개 노드로 동네를 이루고, 필요하면 최대 200개 노드까지 범위를 넓힐 수 있다. 다만 여기서 가까움은 동의를 뜻하지 않는다. 같은 치료법을 다루면서 서로 다른 결과를 낸 연구도 의미상 가까운 이웃이 될 수 있다. 이 도구의 역할은 어느 쪽이 옳은지 판결하는 것이 아니라, 사람이 비교해야 할 주변 문헌을 더 빨리 찾게 하는 데 있다.
검색어 목록을 ‘관계가 보이는 지도’로 바꾸다
PubMed는 인용·초록 레코드 4,000만 건 이상을 보유하고 있다. Linked Discoveries가 출시 당시 탐색 대상으로 삼은 것은 이 가운데 초록과 문헌 유형 조건을 충족한 PubMed 문헌 레코드 2,900만 건 이상이다. PubMed 전체를 연결한 것도, 2,900만 개 노드를 한 화면에 그린 것도 아니다. 이용자가 선택한 시드마다 의미가 가까운 문헌을 불러오고, 최대 200개 이웃 안에서 확보된 관계를 보여주는 방식이다.
기존 PubMed의 ‘Similar Articles’가 단어에 가중치를 매겨 관련 문헌을 순위 목록으로 제시했다면, Linked Discoveries는 의미 기반 이웃에 시간과 인용, 출판 상태 등의 맥락을 겹친다. 그래프와 연도별 타임라인은 같은 이웃 문헌을 공간과 시간이라는 서로 다른 관점에서 보여준다. 이용자는 이웃 가운데 한 편을 다시 시드로 삼아 다음 동네로 탐색을 이어갈 수도 있다.
노드의 색과 모양에도 의미가 있다. 빨간색은 철회 논문을, 금색 영역은 리뷰·체계적 문헌고찰·메타분석·지침·합의문 등을 나타낸다. 연한 파란색 영역은 NIH의 27개 연구소·센터 가운데 하나 이상의 지원을 받은 논문이다. 노드 주변의 후광은 현재 화면에 나타난 이웃 안에서 많이 인용됐다는 뜻이다. 사람이 많이 찾은 식당이라는 표시와 비슷할 뿐, 연구의 정확도나 품질을 보증하는 합격점은 아니다.
노드를 잇는 선은 해당 문헌이 인용한 논문과 해당 문헌을 인용한 논문의 관계를 보여준다. 정보 카드에서는 정정, 우려 표명, 철회 같은 출판 후 변경도 확인할 수 있다. 그러나 이 인용망은 출판사가 제출한 자료와 미국 국립생명공학정보센터(NCBI)의 자원에 의존하므로 모든 참고문헌과 피인용 문헌을 빠짐없이 담은 완전한 지도는 아니다.
문장의 의미를 숫자 좌표로 바꿔 이웃을 찾는다
이웃을 고르는 핵심에는 생의학·임상 텍스트용 언어모델인 BiomedBERT의 미세조정 버전이 있다. 시스템은 논문의 제목·초록·키워드를 ‘임베딩’, 곧 문장의 의미를 숫자 좌표로 바꾼 표현으로 만든 뒤 시드와 좌표상 가까운 레코드를 찾는다. 같은 단어를 정확히 입력하지 않아도 의미가 비슷한 문헌을 만날 가능성을 넓히는 접근이다.
다만 인공지능이 논문의 원문 전체를 읽는 것은 아니다. 표본 구성과 실험 조건, 통계, 연구의 한계, 데이터·코드, 이해상충처럼 본문에만 있는 정보는 유사도 계산에 반영되지 않을 수 있다. 초록이 없는 레코드는 시드나 이웃이 될 수 없고 전기·인터뷰·프리프린트 등 일부 문헌 유형도 제외된다. 정정·우려 표명·철회 공고 자체 역시 시드로 삼을 수 없으며, 연결된 본 논문의 정보 카드에서 상태 변경으로 표시된다.
질환·유전자·화학물질 정보는 각각 MedGen, NCBI Gene, PubChem과 연결해 붙인다. 여러 필터는 조건 가운데 하나 이상을 충족하는 OR 방식과 모든 조건을 충족하는 AND 방식으로 적용할 수 있다. 하지만 이 태그와 인용, 문헌 유형, 연구비, 철회 정보는 의미상 이웃을 먼저 선정한 뒤 붙이는 주석이다. 이웃 후보나 유사도 순위를 정하는 재료는 아니다. 태그가 없다고 해당 주제를 다루지 않았다고 단정할 수 없고, 표준용어 매핑 때문에 초록에 똑같은 단어가 없어도 태그가 붙을 수 있다.
결과는 표로 전환하거나 CSV 파일로 저장할 수 있다. CSV에는 PMID, 제목, 저자, 학술지, 발표 연도, 초록, 태그, 출판 상태 변경과 이웃 안의 인용 관계 등이 담긴다. 새 PubMed 레코드는 매일 추가된다. 질환·유전자·화학물질 태그는 별도 색인을 거치기 때문에 화면에 나타나기까지 최대 약 한 달 늦을 수 있다.
상반된 연구를 보여줄 수 있지만 판정하지는 않는다
이 지도의 가장 중요한 사용법은 ‘가까움’과 ‘옳음’을 구분하는 데 있다. 의미가 비슷한 이웃에는 같은 결론을 지지하는 연구뿐 아니라 다른 방법을 쓴 연구, 상반된 결과를 낸 연구가 함께 나타날 수 있다. 이용자는 발표 연도와 인용선, 초록을 살피고 필요하면 원문까지 확인해 후속·재현·반박 관계를 판단해야 한다. 시스템이 이런 관계를 자동 분류하거나 재현 성공 여부를 판정하지는 않는다.
빨간색 철회 표시도 같은 원칙으로 읽어야 한다. Linked Discoveries가 부정행위를 찾아내거나 논문을 새로 철회하는 것이 아니라, PubMed에 이미 등록된 출판 상태 정보를 눈에 띄게 보여주는 기능이다. 철회되지 않은 논문이 곧 정확한 논문이라는 뜻은 아니며, 철회 논문도 철회 사유와 영향을 받은 주장의 범위를 따로 확인해야 한다.
유사도 점수는 화면에 공개되지 않는다. 순위 사이의 점수 차이가 매우 작을 수 있으므로 1위 문헌이 10위보다 확실히 더 관련 있다고 해석해서도 안 된다. 출시판의 정밀도·재현율, 분야별 오류율, 상반 결론 탐지율, 재현 연구 회수율이나 이용시간 절감 효과를 검증한 공식 벤치마크와 독립 동료심사 연구도 확인되지 않았다. 미국 국립의학도서관(NLM)은 서비스가 초기 단계이며 결과가 불완전하거나 부정확할 수 있다고 밝혔다.
한국 문헌에도 필요한 ‘검증할 주변 증거’
한국 연구자의 논문도 PubMed에 수록되고 초록과 문헌 유형 조건을 충족하면 국적과 관계없이 탐색 대상이 될 수 있다. 다만 한글 제목·한글 초록의 의미 검색 성능, 한국 연구자의 이용 통계, 한국 기관과 NIH의 연계 사업은 확인되지 않았다.
국내에도 각기 다른 문헌 탐색 기반이 있다. KoreaMed는 2025년 6월 기준 회원 학술지 290종과 논문 35만9,237편 이상을 제공하며 초록·DOI·ORCID·자동 부여 MeSH와 원문 연결을 지원한다. 한국과학기술정보연구원의 ScienceON은 인용·피인용 관계와 주요 키워드를 시간순으로 보는 논문타임라인을 소개했고, 한국연구재단의 한국학술지인용색인(KCI)은 국내 학술지의 참고문헌·피인용 관계와 학술지·연구자 인용지표를 제공한다.
확인된 공식 자료만으로 이들 서비스 가운데 하나가 Linked Discoveries처럼 생의학 언어모델로 의미상 이웃을 만들고 철회·리뷰·인용 관계를 하나의 그래프에 결합한다고 단정할 수는 없다. 국내의 다음 질문은 단순히 비슷한 서비스를 보유했느냐가 아니라, 국내 문헌과 인용 데이터에 의미 기반 탐색과 철회·정정 상태를 어떻게 함께 얹을 것인가에 가깝다.
Linked Discoveries는 논문의 진위를 판결하는 인공지능이 아니다. 검색어 목록 속에 흩어져 있던 관계와 시간, 출판 이후의 변화를 한 화면에 모아 사람이 검증할 문헌을 찾도록 돕는 탐색 인프라다. 과학의 결론을 대신 내려주지는 않지만, 한 연구의 주변에 어떤 증거가 놓여 있는지 더 넓고 빠르게 살피게 한다는 데 의미가 있다.
자료: 미국 국립보건원, 미국 국립의학도서관, 미국 국립생명공학정보센터, 한국의학학술지편집인협의회, 한국과학기술정보연구원, 한국연구재단
