[기획] EU, 유전자·단백질·논문 ‘디지털 공공재’ 지킨다…6,500만유로 배정

연구자가 단백질 하나를 검색창에 입력하면 서열과 기능, 관련 질병과 근거 논문이 몇 초 만에 나타난다. 그러나 이 무료 검색창 뒤에서는 새 자료를 모으고, 중복을 걷어내고, 서로 충돌하는 연구 결과를 판정하며, 잘못된 이름과 연결 주소를 고치는 작업이 매일 이어진다. 생명과학 데이터베이스는 한 번 포장하면 끝나는 도로가 아니다. 새 데이터라는 차량이 계속 밀려드는 동안 표지판을 바꾸고 오류라는 포트홀을 메워야 하는 기반시설이다.
유럽연합 집행위원회는 2026년 10월 6일 Horizon Europe 수정 작업계획을 통해 이런 생명과학 데이터·지식 자원에 총 6,500만 유로를 배정했다고 밝혔다. GENCODE에 1,900만 유로, UniProt에 3,000만 유로, Europe PMC에 800만 유로 등 세 지정 자원에 5,700만 유로를 배정하고, 다른 핵심 데이터 저장소와 과학 서비스를 위한 공개 경쟁 공모에 800만 유로를 책정했다. 이미 지급된 돈은 아니며 통상적인 보조금 협약 평가를 조건으로 한 지원 예정이다.
유전자에서 단백질, 근거 논문까지 잇는 세 권의 사전
세 자원은 생명과학 정보망의 서로 다른 층을 맡는다. GENCODE가 “유전체의 어디가 유전자인가”를 표시한다면, UniProt은 “그 유전자가 만든 단백질이 무슨 일을 하는가”를 정리한다. Europe PMC는 “그 판단을 뒷받침하는 논문과 데이터는 무엇인가”를 연결한다. 무료·공개되고 세계 연구자가 함께 이용한다는 점에서 기사상 ‘디지털 공공재’라고 부를 수 있지만, EU가 공식 인증이나 별도 법적 지위를 부여한 것은 아니다.
GENCODE는 인간과 생쥐의 기준유전체에 유전자 위치와 전사체를 표시하는 참조 주석 세트다. DNA를 약 30억 글자의 책으로 본다면, 어느 부분이 문장이고 한 문장을 몇 가지 방식으로 읽을 수 있는지 표시한 목차와 문장부호에 가깝다. 수동 판독과 계산 파이프라인에 RNA·단백질·진화적 보존 증거, 문헌과 실험검증을 결합한다. 2003년 인간 유전체의 약 1%인 약 3,000만 염기를 주석하는 작업으로 출발해 2007년 인간 유전체 전체로 확대됐고, 2012년에는 생쥐 주석을 시작했다.
2025년 5월 동결돼 2026년 6월 공개된 인간 GENCODE 50은 주 염색체 파일 기준 전체 유전자 78,733개와 전사체 644,292개를 담고 있다. 이 가운데 단백질 암호화 유전자는 19,442개, 단백질 암호화 전사체는 278,455개다. 하나의 유전자에서도 여러 RNA 설명서가 만들어질 수 있기 때문에 유전자 수보다 전사체 수가 훨씬 많다. 다만 이는 특정 버전과 분류체계의 통계이지 인간 유전자에 관한 영원한 정답표는 아니다. 새 장독해 RNA와 다양한 조직·집단의 자료가 더해지면 분류도 달라질 수 있다.
UniProt은 단백질의 아미노산 서열에 기능, 세포 내 위치, 변이·질병 정보와 다른 데이터베이스의 연결 정보를 붙인다. 전문가가 검토한 UniProtKB/Swiss-Prot와 계산 주석 중심의 미검토 영역인 UniProtKB/TrEMBL로 나뉜다. 2026_03 릴리스에는 Swiss-Prot 575,748개와 TrEMBL 149,430,635개, 합계 150,006,383개가 들어 있다. 전문가 검토 항목은 약 0.38%로, 약 260개 가운데 259개가 계산 주석 중심인 셈이다.
‘미검토’는 쓸모없거나 믿을 수 없다는 뜻이 아니다. 개별 기능과 근거가 전문가의 완전한 수동 검토를 거치지 않았다는 의미다. 폭증하는 서열을 다루려면 자동화가 불가피하지만, 잘못 추정된 기능이 다른 데이터베이스나 인공지능 학습자료로 연쇄 전파될 위험도 있다. 반대로 사람의 큐레이션도 완전무결하지 않아 문헌 해석 오류가 오랫동안 남아 다른 자원으로 퍼진 사례가 보고됐다.
Europe PMC는 논문의 서지정보와 초록, 원문, 프리프린트를 연구비·데이터·프로토콜·동료평가 자료와 연결한다. 2026년 10월 공식 소개값으로 검색 기록은 4,620만 건, 원문은 1,080만 건이다. 원문 1,080만 편을 편당 10분씩 쉬지 않고 읽어도 약 205년이 걸린다. 이 때문에 유전자·단백질·화학물질 같은 생물학 개념을 자동으로 찾아내는 텍스트마이닝과 API, 대량 데이터 접근 수단이 별도의 연구 인프라가 된다. 자동 주석은 42종 개념에 걸쳐 13억 건 이상이고, 40개가 넘는 생물학 데이터베이스와 연결된다. 다만 원문마다 접근 가능 여부와 엠바고, 오픈액세스 및 상업·대량 재사용 조건이 다르다.
데이터는 네 배, 관리 인력은 5% 증가
EU가 제시한 문제는 세 서비스가 당장 문을 닫는다는 것이 아니다. 단기적이고 분절된 재원 때문에 장기 유지와 서비스 연속성이 압박받는다는 점이다. 이번 지원은 서버뿐 아니라 전문 과학·기술 인력, 큐레이션, 유지관리와 증가하는 데이터 처리에 쓰인다.
그 격차는 ELIXIR이 19개 핵심 데이터 자원 운영자를 대상으로 실시한 2019년 자기보고 조사에서 드러난다. 조사 대상 자원의 데이터 항목은 2014년 9억6,700만 개에서 2018년 38억900만 개로 약 네 배가 됐지만, 담당 인력은 308명에서 325명으로 약 5% 늘었다. 1년 뒤 평균 인력재원 확보 수준은 88%였으나 3년 뒤에는 33%로 떨어졌다. 1년 뒤에도 같은 인력을 전부 유지할 재원을 확보한 자원은 19개 중 5개뿐이었다. 다만 이는 이번 세 자원만의 조사가 아니며, 운영기관이 이후 재원을 확보해 예상된 인력 감소가 현실화하지 않을 가능성도 조사 논문이 함께 밝혔다.
공개 인프라의 편익과 부담 사이에도 간극이 있다. 2025년 사례연구는 UniProt이 연구자의 검색·분석 시간을 줄여 주는 연간 편익을 3억7,300만∼5억6,500만 유로로 추정했다. 2017∼2023년 평균 연간 운영비 1,460만 유로의 25∼39배다. 이는 UniProt의 매출이 아니라 설문을 바탕으로 절약한 시간을 화폐 가치로 환산한 추정치다. 이용자는 세계에 퍼져 있지만 운영비는 일부 국가와 기관, 재단에 집중되는 비용분담 문제도 남는다.
기준 데이터의 품질을 지키되, 영구 해법은 아니다
세 자원은 따로 움직이지 않는다. GENCODE의 유전자 모델은 단백질 정보로 이어지고, UniProt의 기능 설명은 문헌 근거를 필요로 하며, Europe PMC는 논문 속 데이터 식별자를 찾아 원 자료와 연결한다. 한 곳의 오류나 품질 저하는 연결된 분석과 자동화 시스템으로 번질 수 있다. 공개 데이터가 바이오 인공지능 학습에 쓰일수록 기준 데이터의 관리가 중요해지는 이유다. 다만 공개 데이터를 학습했다는 사실만으로 인공지능 결과의 신뢰성이 보장되지는 않는다. 종·집단·연구주제의 편향과 기존 자동 주석 오류도 함께 들어갈 수 있다.
이번 배정은 2025년 7월 시작된 유럽 생명과학 전략과 같은 해 9월 발표된 유럽 연구·기술 인프라 전략의 후속 조치다. 그러나 영구기금은 아니다. 직접 확인된 지원기간은 GENCODE의 5년뿐이며 UniProt과 Europe PMC에 같은 기간을 적용할 수 없다. 세 지정 자원과 금액을 어떤 비교평가로 골랐는지도 짧은 공식 발표에서는 확인되지 않았다. 다른 핵심 자원들이 경쟁할 수 있는 몫은 전체의 약 12.3%인 800만 유로다.
한국 연구자와 기업도 세 자원의 공개 데이터와 API를 이용할 수 있다. 국내에는 한국생명공학연구원 국가생명연구자원정보센터가 운영하는 국가 바이오 데이터 스테이션 K-BDS가 있지만 역할은 같지 않다. K-BDS는 국가 연구개발에서 나온 바이오 데이터를 수집·관리하고 검색·분석 환경을 제공하는 성격이 강하다. GENCODE와 UniProt은 국제적으로 표준화하고 큐레이션한 참조 지식베이스이며, Europe PMC는 논문과 데이터를 잇는 문헌 인프라다.
결국 6,500만 유로는 새 데이터베이스를 여는 비용이라기보다 이미 세계 연구가 의존하는 지식의 도로를 계속 쓸 수 있게 관리하는 비용에 가깝다. 유럽이 국제 인프라의 유럽 측 부담을 더 맡는 조치이기도 하다. 그러나 일정 기간 뒤의 후속 재원, 다른 핵심 자원과의 형평성, 세계 이용자 사이의 비용분담이라는 질문은 그대로 남는다.
자료: 유럽연합 집행위원회 연구혁신총국, EMBL-EBI, 스페인 유전체조절센터, GENCODE 컨소시엄, UniProt 컨소시엄, 스위스 생물정보학연구소, Europe PMC, 미국 국립보건원, 미국 국립의학도서관, ELIXIR, KOBIC
