추석 연휴인데 사무실에 나와 컴퓨터를 두드리고 있다. 다음 주 싱가포르에서 열리는 제14차 GA4GH(Global Alliance for Genomics and Health) Plenary Meeting에 참석하기 위한 준비 때문이다. 연휴에 굳이 사무실까지 나와야 하나 싶기도 하지만, 이번에는 단순히 학회에 참석하는 것만으로 끝날 일이 아니다.
한국에서는 국가통합바이오빅데이터구축사업(BIKO)에 참여하는 주요 인사들이 대거 참석한다. 나도 일행 중 한 사람으로서 Patrick Tan을 비롯한 PRECISE(Precision Health Research, Singapore)의 주요 인사들과 만날 예정이다. 만나서 무슨 이야기를 할 것인가 생각하다 보니 당연히 싱가포르의 국가 정밀의료 사업인 NPM(National Precision Medicine)을 공부하지 않을 수 없었다. 많은 미팅을 주선한 사업단 관계자들께 특별한 감사의 뜻을 전한다.
때마침 아주 적절한 논문도 나와 있었다. 2026년 8월 Nature Genetics에 실린 “Translating genomic data into healthcare practice with the Singapore National Precision Medicine program”이라는 Perspective 논문이다. Patrick Tan을 비롯한 PRECISE 관계자들이 대거 저자로 참여했다. 제목부터 노골적으로 translating genomic data into healthcare practice이다. 너무 길어서 읽기가 불편하다면 PRECISE 웹사이트에 실린 소개의 글만 봐도 도움이 될 것이다.
처음에는 다음 주 미팅을 위해 필요한 내용만 뽑아 읽을 생각이었다. 그런데 읽다 보니 생각보다 재미있었다.
우리는 BIKO와 같은 대규모 바이오데이터 구축 사업의 활용을 이야기할 때 대체로 두 가지를 떠올린다. 연구자가 데이터를 이용하여 좋은 논문을 쓰는 것, 그리고 기업이 이를 이용하여 신약이나 새로운 진단기술을 개발하는 것이다. 나 역시 별다른 의심 없이 그렇게 생각해 왔다.
그런데 싱가포르 NPM에는 그 사이에 한 단계가 더 있었다. Clinical Implementation Pilot(CIP)이다. 연구에서 얻은 유전체 지식을 실제 진료 과정에 집어넣어 보고, 임상적으로 정말 도움이 되는지, 비용을 들일 만한 가치가 있는지를 검증한 뒤 실제 의료체계로 옮기는 것이다. 가족성 고콜레스테롤혈증(familial hypercholesterolemia, FH)은 그렇게 해서 국가적인 유전자 검사 및 관리 프로그램으로 이어졌다. 지난주 보스턴에서 열렸던 International Precision Health Summit에서 UK Biobank 관계자도 비슷한 내용을 이야기하였다. 당시에 찍었던 발표 자료를 여기에 소개해 둔다. 2035년이 되면 영국의 전체 의료 서비스 이용에서 최대 절반에서 유전체 정보가 어떤 형태로든 활용될 수 있다고 한다. 정말 부럽지 않은가?
논문을 읽지 않고 AI가 만들어 준 digest 정도만 보았더라면 아마 “SG100K를 구축했고 연구와 임상 활용을 추진하고 있다” 정도로 이해하고 넘어갔을 것이다. 틀린 말은 아니지만 정작 중요한 것이 빠진다. 연구 결과가 저절로 의료가 되는 것이 아니라 그 사이에 clinical pathway를 만들고, health economics를 따지고, 실제 의료체계 안에서 시험하는 과정이 있었다.
NPM이 Phase I을 proof of concept, Phase II를 proof of value, 현재의 Phase III를 proof of scale이라고 부르는 이유도 이제 조금 이해가 되었다.
그런데 이 논문을 읽다가 나의 관심은 엉뚱한 방향으로 흐르기 시작했다.
그런데 우리는 도대체 누구의 유전체를 보고 있는 것일까?
싱가포르는 Chinese, Malay, Indian이 함께 사는 나라이다. PRECISE-SG100K 역시 이 세 population을 중심으로 만들어진 multi-ancestry Asian cohort이다. 그러다 보니 서로 다른 아시아 국가에서 생산한 유전체 데이터를 함께 분석하려면 무엇을 맞추어야 하는지가 궁금해졌다. 다음 주 PRECISE 사람들과 이야기를 나눌 만한 주제이기도 했다.
그런데 생각은 여기서 한 번 더 옆길로 샜다. Harmonize한다는 것이 정확히 무엇이지? Sequencing depth와 QC 기준을 맞추고, variant calling pipeline을 통일하는 것까지는 쉽게 생각할 수 있다. 그런데 reference genome이 다르면 어떻게 하지?
여기에서 또 하나의 아주 기초적인 질문이 튀어나왔다.
그런데 GRCh38은 도대체 누구의 유전체인가?
좀 당황스러운 질문이다.
GRCh37과 GRCh38은 오랫동안 들어와서 잘 알고 있다. Reference가 다르면 좌표를 변환해야 한다는 것도 알고, 최근에는 T2T-CHM13이 나왔다는 것도 알고, Human Pangenome이라는 것도 대충 알고 있었다.
그런데 정작 “GRCh38은 누구의 유전체인가?”라는 질문에는 즉시 대답할 수가 없었다.
생각해 보니 내가 가지고 있던 지식은 조각조각이었다. Human Genome Project에서 여러 사람의 DNA를 사용했다는 이야기도 어디선가 들었고, reference genome은 어느 한 사람의 genome이 아니라는 것도 알고 있었다. 한 사람의 샘플이 꽤 많은 비중을 차지한다는 것 정도는 알고 있었지만, 그것들이 머릿속에서 하나의 이야기로 연결되어 있지는 않았다.
그래서 찾아보기 시작했다.
GRCh38의 70%를 차지하는 RP11
Genome Reference Consortium의 설명을 읽어 보니 GRCh38은 여러 익명의 사람에게서 만든 genomic clone library의 염기서열을 조합한 composite genome이다. 여기까지는 예상했던 바이다.
그런데 구성 비율이 예상 밖이었다.
GRCh38 primary assembly의 약 93%가 11개의 genomic clone library에서 왔고, 그 가운데 RP11(RPCI-11 Human Male BAC Library)이라는 하나의 library가 혼자서 약 70%를 차지한다.
무려 70%라니!
여러 사람의 유전체를 골고루 섞어서 만든 reference 같은 것을 막연히 상상했다면 꽤 많이 틀린 셈이다. 실질적으로 GRCh38의 대부분은 한 사람에게서 온 것이다.
Genome Reference Consortium: Frequently Asked Questions
그런데 더 의외의 사실이 하나 있었다.
RP11 donor는 익명의 남성인데, 유전체를 분석해 보니 African-European admixed ancestry를 가진 것으로 추정된다는 것이다. 후속 연구에서는 RP11이 GRCh38의 72.6%를 차지한다고 계산했고, ancestry를 판별할 수 있었던 RP11 clone 가운데 56.0%는 African, 28.1%는 European local ancestry로 분류했다. 논문에서는 이 donor를 admixed African-American ancestry를 가진 사람이라고 표현한다.
어라?
나 역시 reference genome의 population bias를 이야기하면서 별 생각 없이 ‘Western population 중심의 reference’ 같은 표현을 사용하곤 했다. 그런데 GRCh38의 대부분을 제공한 사람이 내가 막연히 상상했던 European ancestry의 ‘백인 표준 인간’이 아니었다. 아, 여기에서 매우 주의해야 한다. 백인이 모든 인종의 표준이라는 의미로 읽지는 말기를 바란다.
더 재미있는 것은 두 번째로 큰 CTD library이다. GRCh38의 약 5.5%를 차지하는데, ancestry를 분석할 수 있었던 clone의 86.3%가 East Asian local ancestry로 추정되었다.
Aganezov et al. A complete reference genome improves analysis of human genetic variation
그러니까 GRCh38은 European genome도 아니고 African genome도 아니며, 당연히 Asian genome도 아니다.
애초에 그런 식으로 이해할 물건이 아니었다.
여러 사람에게서 얻은 DNA 조각을 이어 붙여 만든 mosaic reference이고, 그중 압도적으로 많은 부분이 한 admixed donor에게서 왔다.
그러면 T2T-CHM13은 좀 나은가?
여기까지 오니 당연히 다음 질문이 생겼다.
GRCh38이 이렇게 복잡한 물건이라면 2022년에 ‘완성된 인간 유전체’로 등장한 T2T-CHM13은 어떨까?
T2T-CHM13은 대단한 성과이다. GRCh38에서 제대로 조립하지 못했던 centromere, segmental duplication, 반복서열 등의 영역을 포함하여 telomere에서 telomere까지 이어지는 거의 완전한 인간 유전체를 만들었다.
그런데 CHM13의 정체를 알고 나면 여기에서도 이야기가 묘해진다.
CHM13은 일반적인 사람의 혈액에서 얻은 평범한 diploid genome이 아니라고 한다. Complete hydatidiform mole(완전포상기태)에서 유래한 세포주이다. 쉽게 말하면, 난자의 핵 DNA가 없는 상태에서 들어온 한 정자의 haploid genome이 복제되어 두 벌이 된 것에 가깝다. 따라서 염색체 수는 46개이지만 두 벌의 서열이 거의 동일하다. 보통 사람처럼 부계와 모계에서 물려받은 서로 다른 두 haplotype을 구별할 필요가 거의 없으므로, 완전한 genome assembly를 만들기에 매우 유리했다.
즉 CHM13이 선택된 것은 이 사람이 인류를 가장 잘 대표해서가 아니다. 완전한 genome을 조립하기에 아주 좋은, 다소 특별한 생물학적 재료였기 때문이다.
그런데 ancestry까지 들여다보면 CHM13은 대체로 European ancestry를 가진 genome이다.
여기서 또 한번 머리를 긁적이게 된다.
|
|
| 뚜껑이 열릴 일이다. 팀 버튼의 <크리스마스 악몽>(1993) 중에 출연한 Dr. Finkelsterin. |
GRCh38은 여러 사람의 DNA가 섞여 있고 그 대부분은 African-European admixed donor에서 왔다. T2T-CHM13은 훨씬 완전하지만 사실상 하나의 haplotype에 가까운 genome이고 predominantly European ancestry이다.
완전한 인간 유전체(complete human genome)가 인류를 대표하는 유전체(representative human genome)라는 뜻은 아니다.
생각해 보면 너무나 당연한 말인데 나는 두 가지를 은연중에 같은 문제처럼 생각하고 있었던 것 같다. Completeness와 population diversity는 전혀 다른 문제이다.
아, 그래서 Pangenome을 써야 하는구나
여기까지 오고 나니 Human Pangenome이 갑자기 다르게 보였다.
전에는 pangenome을 ‘여러 사람의 유전체를 더 많이 모아서 만든 더 좋은 reference’ 정도로 막연히 이해하고 있었다. 그러나 문제의 핵심은 reference에 sequence를 조금 더 추가하는 데 있는 것이 아니었다.
한 사람 또는 소수 사람의 linear genome 하나를 기준으로 모든 인간의 variation을 기술하는 방식 자체에 한계가 있는 것이다.
Human Pangenome Reference Consortium(HPRC)이 2023년에 발표한 첫 draft human pangenome은 서로 다른 ancestry를 가진 47명의 phased diploid assembly를 이용했다. GRCh38과 비교하면 약 119 million base pairs의 euchromatic polymorphic sequence가 추가되었고, small variant와 structural variant를 찾아내는 성능도 향상되었다.
Liao et al. A draft human pangenome reference. Nature 617, 312–324 (2023)
여기서 또 하나 궁금해졌다. Pangenome은 여러 사람의 유전체를 단순히 이어 붙인 거대한 FASTA 파일이 아니다. 여러 haplotype의 서로 다른 경로를 graph 형태로 표현한다. 그렇다면 지금까지 GRCh38이라는 하나의 linear reference를 놓고 BWA로 read를 mapping하던 방식도 달라져야 한다. 실제로 pangenome에서는 vg Giraffe와 같은 graph-aware mapper가 사용된다. 다만 graph 안에 GRCh38이나 CHM13과 같은 기존 reference를 하나의 path로 유지할 수 있으므로, 기존 좌표계와의 연결을 완전히 포기하는 것은 아니다. 결국 pangenome의 문제는 reference sequence 하나를 바꾸는 것에 그치지 않고, mapping에서 variant representation, 그리고 좌표계에 이르는 분석 체계 전체를 바꾸는 문제인 셈이다.
하지만 여기에서도 ‘이제 인류의 다양성을 충분히 대표한다’고 말하기는 어렵다. 이것은 어디까지나 47명으로 만든 첫 draft였고, HPRC 자체도 더 많은 사람과 population을 포함하는 방향으로 확장하고 있다. 한편 중국에서는 36개 population을 대상으로 별도의 Chinese pangenome reference를 구축했다.
Gao et al. A pangenome reference of 36 Chinese populations. Nature 619, 112–121 (2023)
그러면 또 문제가 생긴다.
한국인은 한국인에게 더 잘 맞는 reference를 만들고, 중국은 중국 population을 위한 pangenome을 만들고, 싱가포르는 Chinese, Malay, Indian을 포함하는 reference를 만들면 각 population의 분석에는 분명 도움이 될 것이다.
그런데 그렇게 만든 데이터를 나중에 한데 모아 분석하려면 어떻게 하지?
결국 다시 PRECISE로 돌아왔다
처음에는 다음 주 PRECISE 사람들과 무엇을 이야기할 것인지 준비하다가 여기까지 흘러왔다.
이번에 읽은 Nature Genetics 논문에서 PRECISE-SG100K는 Chinese, Malay, Indian을 중심으로 한 multi-ancestry Asian population resource로 소개된다. 싱가포르 NPM은 Phase III가 끝날 무렵에는 국민의 약 10%를 genetically mapped population으로 만들겠다는 계획을 갖고 있다.
논문은 또 PRECISE가 GA4GH의 WGS Quality Control Standards, Regulatory and Ethics Work Stream, federated gnomAD, National Initiatives Forum 등에 참여하고 있다고 설명한다. 그리고 공교롭게도 내가 다음 주 참석할 2026년 제14차 GA4GH Plenary가 아시아에서는 처음으로 싱가포르에서 열린다는 내용도 이 논문에 들어 있다.
그러니 이 문제를 그들과 이야기해 보지 않을 이유가 없다.
아시아 각국이 자기 population에 더 적합한 reference 또는 pangenome을 사용하기 시작한다면, 그 장점을 살리면서도 국가 간 데이터의 interoperability를 어떻게 유지할 것인가. 또 T2T와 human pangenome이 등장한 지금, 언제까지 GRCh38이라는 하나의 linear reference에 의존할 것인가. 그렇다고 지난 수십 년 동안 GRCh37과 GRCh38을 기준으로 축적한 방대한 데이터를 버릴 수도 없다.
다음 주에는 질문을 할 기회가 주어진다면 이런 이야기도 한번 꺼내 볼 생각이다. 어떤 답을 들을 수 있을지 궁금하다.
처음의 의문은 우리 식으로 말하자면 biosample의 provenance에 관한 것이었다. GRCh38이라는 reference를 구성한 DNA는 도대체 누구에게서 왔는가? 어떤 시료에서 만들어졌고, 그 시료를 제공한 사람의 ancestry는 무엇인가? 평소 데이터를 다루면서 provenance의 중요성을 그렇게 강조하면서도, 정작 가장 들어 온 reference genome의 provenance에 대해서는 제대로 알고 있지 못했다.
그런데 RP11을 거쳐 T2T-CHM13과 human pangenome까지 따라가고 나니 질문의 성격이 달라졌다. 처음에는 reference를 만든 시료의 출처가 궁금했는데, 점차 ‘무엇을 reference라고 부를 것인가’로 질문이 바뀌고 있었다.
GRCh38에서는 여러 사람의 DNA 조각을 하나의 linear genome으로 조립했다. T2T-CHM13에서는 거의 하나의 haplotype으로부터 훨씬 완전한 genome을 만들었다. 그리고 pangenome에 와서는 하나의 linear sequence가 모든 사람을 대표해야 한다는 전제 자체에서 벗어나기 시작했다. Reference가 더 정확해졌다기보다 reference라는 개념 자체가 달라지고 있는 셈이다.
이것은 과거 Human Genome Project의 역사를 되짚어 보는 잡학으로 끝날 문제도 아니다. BIKO에서 수십만 명의 유전체를 만들고, 언젠가 SG100K를 비롯한 다른 아시아 국가의 데이터와 함께 분석하려 한다면 각 population의 다양성을 더 잘 표현하는 것과 서로 다른 데이터 사이의 interoperability를 유지하는 것을 동시에 해결해야 한다.
추석 연휴에 다음 주 국외 출장 준비를 하다가 생각보다 멀리 와 버렸다. 시작은 biosample의 provenance였는데, 끝에 와 보니 질문은 전혀 다른 것이 되어 있었다.
앞으로 우리는 무엇을 reference라고 부르게 될까?














