※ 이 글은 다음 주 싱가포르에서 열리는 제14차 GA4GH Plenary meeting 참석을 앞두고 개인적인 공부를 위해 작성한 것이다. GA4GH의 개념과 관련 자료를 이해하기 위해 생성형 AI(ChatGPT)와 대화하면서 초안을 자동 생성하고, 내용을 검토·수정하여 정리하였다. 따라서 GA4GH나 소속기관의 공식 입장을 나타내는 글이 아니다.
연구데이터를 공유해야 한다는 데에는 이제 큰 이견이 없다.
Open Science와 FAIR Data가 연구정책의 중요한 원칙이 되었고,
공공 연구비로 생산한 데이터는 가능한 한 널리 재사용할 수 있어야 한다는 요구도 강해졌다.
그러나 바이오데이터, 특히 사람의 유전체와 임상정보를 다루기 시작하면 이야기는 금방 복잡해진다.
모든 데이터를 인터넷에서 자유롭게 내려받게 하는 것이 과연 가장 바람직한 데이터 공유일까?
더 나아가 데이터를 반드시 한곳에 모아야 할까? 원자료를 분산해서 보관하더라도, 적어도 메타데이터만큼은 한곳에 모아야 제대로 검색하고 활용할 수 있는 것일까?
어쩌면 우리는 지금까지 ‘공유’를 너무 쉽게 한곳에 모으고, 한곳에서 검색하고, 필요한 데이터를 내려받는 것으로 생각해 온 것은 아닐까?
그렇지 않다. 오히려 오늘날의 바이오데이터 인프라를 이해하려면
다음 세 가지 sharing architecture를 구별해 볼 필요가 있다.
- Open-access repository
- Controlled-access repository / environment
- Federated data-sharing infrastructure
이 세 가지는 앞의 방식이 낡아서 뒤의 방식으로 대체되는 발전단계가 아니다.
데이터의 성격과 위험, 그리고 연구환경에 따라 서로 다른 방식이 필요하며 실제로는 함께 존재한다.
1. 가장 단순하고 강력한 모델: Open-access repository
생명정보학 연구자에게 가장 익숙한 것은 공개 데이터 저장소이다.
연구자가 데이터를 생산하고 repository에 제출하면 accession이 부여되고,
다른 연구자는 검색하여 데이터를 내려받는다.
Researcher
↓ submit
Repository
↓ search / download
Research community
염기서열 데이터에서는 INSDC가 대표적인 사례이다.
GenBank, ENA, DDBJ가 데이터를 국제적으로 교환함으로써
연구자는 공개된 nucleotide sequence data를 전 세계 어디에서나 활용할 수 있다.
이 모델은 현대 생명과학 발전에 엄청난 기여를 했다.
논문에 염기서열 몇 줄을 싣는 대신 accession을 제시하면
전 세계 연구자가 동일한 원자료를 다시 사용할 수 있게 되었다. 이처럼 연구데이터를 가능한 한 제약 없이 이용할 수 있게 하는 Open Access는 Open Science의 이상과도 매우 잘 맞는다.
Open Science의 이상과도 매우 잘 맞는다.
그러나 여기에서 중요한 구별이 하나 필요하다.
Open Science가 반드시 모든 데이터를 Open Access, 즉 누구나 별도의 접근 승인을 받지 않고 이용할 수 있는 형태로 제공하라는 뜻은 아니다.
개인정보, 임상정보, human genomic data처럼 공개함으로써
연구참여자에게 위험을 초래할 수 있는 데이터에는 정당한 접근 제한이 필요하다.
UNESCO의 Recommendation on Open Science도 scientific knowledge는
가능한 한 개방되어야 하지만 privacy, confidentiality, human subjects 보호 등의 이유로
정당화되고 비례적인 접근 제한을 둘 수 있으며,
필요한 경우 defined access criteria에 따른 mediated access를 사용할 수 있음을 명시하고 있다.
따라서 Open Science의 반대말이 Controlled Access인 것은 아니다.
오히려 Controlled Access 역시 책임 있는 Open Science를 구현하는 한 방법이라고 볼 수 있다.
2. 사람의 유전체가 등장하면서 문제가 달라졌다
사람의 genome은 일반적인 연구데이터와 성격이 다르다.
이름과 주민등록번호를 제거했다고 해서 완전히 익명이라고 단정하기 어렵다.
Genotype이나 molecular sequence 자체가 개인 식별 가능성을 가질 수 있고,
phenotype이나 clinical information과 결합되면 위험은 더 커질 수 있다.
따라서 human genomic data에서는 다음과 같은 모델이 필요해졌다.
Researcher
↓ request
Data Access Committee
↓ review
Controlled-access repository
↓ approved access
Researcher
미국 NIH의 dbGaP가 대표적인 사례이다.
연구자는 단순히 회원가입을 하고 controlled data를 내려받는 것이 아니라
Data Use Certification을 포함한 access request를 제출한다.
NIH Data Access Committee(DAC)는 제안된 연구목적이
연구참여자의 consent와 해당 dataset에 설정된 제한조건에 부합하는지를 검토한다.
따라서 핵심 질문은 더 이상 단순한 availability가 아니다.
Can I find the data?
에 더하여
Am I allowed to use the data
for this particular purpose?
라는 질문이 등장한다.
이것이 Controlled Access의 세계이다.
3. 하지만 Controlled-access repository만으로도 충분하지 않다
여기까지는 여전히 repository 중심의 사고방식이다.
승인을 받으면 데이터를 repository에서 연구자가 있는 곳으로 가져오는 방식을 생각하기 쉽다.
Repository
↓
approved download
↓
Researcher's environment
그러나 dataset이 수십 TB, 수백 TB가 되고 여러 병원과 국가에 분산되면 상황이 달라진다.
더 중요한 것은 모든 데이터를 하나의 중앙 repository로 옮기는 것 자체가
불가능하거나 바람직하지 않을 수 있다는 점이다.
병원 A의 데이터는 병원 A에 있어야 하고,
병원 B의 데이터는 병원 B의 governance 아래 있어야 할 수 있다.
한국의 데이터와 싱가포르의 데이터에는 서로 다른 법률과 consent,
access policy가 적용될 수도 있다.
그렇다면 새로운 질문이 생긴다.
데이터를 한곳에 모으지 않고도 하나의 연구 인프라처럼 사용할 수는 없을까?
여기에서 Federation이라는 개념이 중요해진다.
4. GA4GH가 풀려는 문제
GA4GH(Global Alliance for Genomics and Health)는
거대한 국제 유전체 데이터베이스를 만들려는 조직이 아니다.
GA4GH는 genomic and health community가 실제로 필요로 하는
technical standards와 regulatory·ethical policy tools를 개발한다.
그 목적은 서로 독립적으로 관리되는 genomic and health data infrastructure가
안전하고 책임 있는 방식으로 함께 작동할 수 있게 하는 데 있다.
예를 들어 연구자는 먼저 데이터가 어디에 있는지 찾아야 한다.
Researcher
↓
Beacon
↓
┌─────┼─────┐
↓ ↓ ↓
Korea Singapore Europe
Beacon은 관련 데이터가 존재하는지를 찾게 해준다.
데이터 자체를 연구자에게 곧바로 넘겨주는 서비스는 아니다.
그 다음에는 그 데이터가 어떤 목적으로 사용될 수 있는지를 알아야 한다.
Dataset
↓
DUO
DUO(Data Use Ontology)는 dataset의 permitted use를
machine-readable하게 표현하기 위한 ontology이다.
반대편에는 연구자가 있다.
Researcher
↓
Passport / Visa
연구자가 누구인지, 어떤 자격과 authorization을 가지고 있는지를
서로 다른 기관이 신뢰할 수 있는 방식으로 전달할 필요가 있다.
그리고 실제 data object를 표준적인 방식으로 가리키고 접근하기 위해
DRS(Data Repository Service)와 같은 interface를 사용할 수 있다.
이렇게 되면 서로 다른 기관이 반드시 같은 software나 같은 storage를 사용할 필요가 없다.
중요한 것은 같은 시스템을 사용하는 것이 아니라 서로 이해할 수 있다는 것이다.
5. 더 나아가 데이터를 움직이지 않을 수도 있다
Federation에서 특히 흥미로운 변화는 분석 방식에서 나타난다.
전통적인 모델은 다음과 같다.
DATA
↓
Researcher
연구자가 데이터를 내려받아 자신의 compute environment에서 분석한다.
그러나 sensitive genomic data에서는 반대로 할 수 있다.
WORKFLOW
↓
DATA
즉 연구자의 분석 workflow를 데이터가 존재하는 secure compute environment로 보내는 것이다.
흔히 compute-to-data 또는 bring the algorithms to the data라고 표현한다.
GA4GH의 WES(Workflow Execution Service)와
TES(Task Execution Service)는 이런 방식의 federated analysis를 지원할 수 있는
표준 interface를 제공한다.
따라서 여기에서는 데이터 공유라는 말 자체의 의미가 달라질 수 있다.
과거에는 흔히
데이터를 공유한다 = 파일을 전달한다
라고 생각했다.
Federation에서는 이를 다음처럼 생각할 수도 있다.
데이터를 공유한다 = 허가된 연구자가 그 데이터로부터 연구결과를 얻을 수 있게 한다.
파일 자체가 연구자의 컴퓨터로 전달되지 않아도 데이터는 연구에 활용될 수 있다.
6. 세 가지 모델을 비교해 보자
|
Open-access repository |
Controlled-access repository |
Federated infrastructure |
| 대표 질문 |
데이터가 공개되어 있는가? |
내가 이 데이터를 이 목적으로 사용할 수 있는가? |
서로 다른 기관의 데이터를 함께 사용할 수 있는가? |
| 접근 방식 |
공개 검색·다운로드 |
신청·심의·승인 |
Discovery + authorization + interoperable access/compute |
| 데이터 위치 |
Repository |
Controlled repository / secure environment |
여러 기관에 분산 가능 |
| 연구자 인증 |
상대적으로 단순 |
중요 |
기관 간 신뢰 가능한 identity가 특히 중요 |
| Data-use restriction |
상대적으로 적음 |
핵심 요소 |
Machine-readable policy와 기관 간 trust가 중요 |
| 분석 방식 |
주로 다운로드 후 분석 |
승인 후 다운로드 또는 secure environment |
Compute-to-data 가능 |
| 대표 사례/개념 |
INSDC 등 |
dbGaP, EGA 등 |
GA4GH standards를 활용한 federated ecosystem |
| 핵심 가치 |
Openness |
Responsible access |
Interoperability + Trust + Local control |
여기에서 중요한 것은 이 세 모델을 우열관계로 보지 않는 것이다.
공개할 수 있는 nucleotide sequence를 굳이 복잡한 access-control system 안에 넣을 필요는 없다.
반대로 identifiable human genomic data를
Open Science라는 이유만으로 unrestricted download하게 만들어서도 안 된다.
그리고 데이터가 여러 병원과 국가에 분산되어 있다면
하나의 controlled repository로 모두 복사하는 것보다
federation이 적절할 수 있다.
결국 데이터의 성격에 맞는 sharing architecture를 선택해야 한다.
7. Open과 Closed 사이에는 넓은 공간이 있다
이런 관점에서 보면 데이터 공유를
OPEN ←────────────────────────→ CLOSED
라는 한 축으로만 생각하는 것이 오히려 문제일 수 있다.
실제 연구데이터 infrastructure에는 훨씬 다양한 access model이 존재한다.
Open download
↓
Registered access
↓
Controlled access
↓
Secure analysis environment
↓
Federated analysis
아래로 내려간다고 반드시 데이터가 덜 공유되는 것은 아니다.
예를 들어 100,000명의 genome을 연구자에게 직접 다운로드하게 하는 것보다
secure environment 안에서 승인된 workflow를 실행할 수 있게 하는 것이
개인정보를 더 잘 보호하면서도 실제 연구 활용성을 높이는 방법이 될 수 있다.
따라서 중요한 질문은
How open is the data?
하나만이 아닐 것이다.
어쩌면 더 중요한 질문은
How usable is the data under appropriate governance?
일 수 있다.
8. 결국 핵심은 Trust이다
Open repository에서는 trust 문제가 상대적으로 단순하다.
누구나 데이터를 사용할 수 있기 때문이다.
Controlled access에서는 연구자를 신뢰해야 한다.
Federation에서는 한 단계 더 나아간다.
기관이 다른 기관을 신뢰해야 한다.
Can Hospital A trust
the identity issued by Institution B?
Can Singapore trust
an access authorization from Korea?
Can the data custodian trust
the workflow submitted by a foreign researcher?
따라서 API 몇 개를 연결한다고 federation이 완성되는 것은 아니다.
오늘 공부하면서 나는 federation의 핵심을 다음과 같이 정리하게 되었다.
Federation = Trust + Interoperability + Local control
9. 다시 Open Science로 돌아가면
이제 처음의 질문으로 돌아가 보자.
Open Science는 모든 연구데이터를 인터넷에 공개하는 것일까?
적어도 바이오데이터에서는 그렇게 단순하게 정의하기 어렵다.
Open Science가 추구해야 할 것을 반드시 unrestricted access라고 보기보다
maximum responsible reuse라고 생각하는 편이 더 적절할 수도 있다.
공개 가능한 데이터는 open repository에 둔다.
민감하지만 연구가치가 높은 데이터는 controlled access로 제공한다.
그리고 물리적으로 이동시키기 어렵거나
서로 다른 기관의 governance 아래 있어야 하는 데이터는
federation을 통해 발견하고, 허가받고, 분석한다.
OPEN-ACCESS REPOSITORY
│
│
CONTROLLED ACCESS
│
│
FEDERATED ACCESS & ANALYSIS
이들은 서로 경쟁하는 모델이 아니다.
데이터를 가능한 한 많이 공유하면서도,
그 데이터가 요구하는 책임을 지키기 위해 만들어진 서로 다른 도구들이다.
이렇게 생각하고 나니 GA4GH의 의미도 조금 다르게 보인다.
GA4GH는 Open Science를 제한하기 위한 체계라기보다,
단순한 Open Access로는 공유할 수 없는 genomic and health data까지
책임 있는 재사용의 영역으로 끌어들이기 위한
기술적·governance적 시도라고 볼 수 있지 않을까.
GA4GH 스스로도 genomic and health-related data의 공유가
human health의 발전에 중요하다고 전제하면서,
privacy, non-discrimination, procedural fairness와 human rights에 기반한
responsible data sharing을 강조한다.
다음 주 싱가포르에서 실제 GA4GH community의 사람들을 만나고
Plenary의 여러 발표를 들으면서,
오늘 공부하며 만들어 놓은 이 그림이 실제 현장에서는 어떻게 구현되고 있는지 확인해 보고 싶다.
참고자료
- UNESCO, Recommendation on Open Science
https://www.unesco.org/en/legal-affairs/recommendation-open-science
- GA4GH, Framework for Responsible Sharing of Genomic and Health-Related Data
https://www.ga4gh.org/framework/
- GA4GH, What We Do
https://www.ga4gh.org/what-we-do/
- GA4GH, About Us
https://www.ga4gh.org/about-us/
- NIH dbGaP, Requesting Controlled-Access Data
https://www.ncbi.nlm.nih.gov/projects/gap/cgi-bin/about.html