Skip to main content
QUICK REVIEW

[논문 리뷰] A Cross-Level Information Transmission Network for Predicting Phenotype from New Genotype: Application to Cancer Precision Medicine

Di He, Lei Xie|arXiv (Cornell University)|2020. 10. 09.
Machine Learning in Bioinformatics참고 문헌 34인용 수 5
한 줄 요약

이 논문은 유전자형(돌연변이)에서 표현형(항암제 민감도)으로의 비대칭적 정보 흐름을 중간 오미크스 레이어(예: 유전자 발현)를 통해 모델링하는 딥러닝 프레임워크인 크로스레벨 정보 전달(CLEIT)을 제안한다. 대조 손실과 레이블이 없는 데이터에 대한 사전 훈련을 통해 CLEIT는 유전자형만으로도 암세포의 항암제 반응을 예측하는 데 성능을 향상시켰으며, 최신 기술(SOTA)보다 피어슨 상관계수(약물별)로 13.3% 향상되고, 상위 5개 정밀도로 5% 향상되었다.

ABSTRACT

An unsolved fundamental problem in biology and ecology is to predict observable traits (phenotypes) from a new genetic constitution (genotype) of an organism under environmental perturbations (e.g., drug treatment). The emergence of multiple omics data provides new opportunities but imposes great challenges in the predictive modeling of genotype-phenotype associations. Firstly, the high-dimensionality of genomics data and the lack of labeled data often make the existing supervised learning techniques less successful. Secondly, it is a challenging task to integrate heterogeneous omics data from different resources. Finally, the information transmission from DNA to phenotype involves multiple intermediate levels of RNA, protein, metabolite, etc. The higher-level features (e.g., gene expression) usually have stronger discriminative power than the lower level features (e.g., somatic mutation). To address above issues, we proposed a novel Cross-LEvel Information Transmission network (CLEIT) framework. CLEIT aims to explicitly model the asymmetrical multi-level organization of the biological system. Inspired by domain adaptation, CLEIT first learns the latent representation of high-level domain then uses it as ground-truth embedding to improve the representation learning of the low-level domain in the form of contrastive loss. In addition, we adopt a pre-training-fine-tuning approach to leveraging the unlabeled heterogeneous omics data to improve the generalizability of CLEIT. We demonstrate the effectiveness and performance boost of CLEIT in predicting anti-cancer drug sensitivity from somatic mutations via the assistance of gene expressions when compared with state-of-the-art methods.

연구 동기 및 목표

  • 환경적 요동에 의해 영향을 받는 새로운 유전자형(체세포 돌연변이)으로부터 표현형(예: 약물 민감도)을 예측하는 문제를 해결하기 위해.
  • 고차원 오미크스 데이터, 레이블이 부족한 데이터, 이질적인 데이터 통합 등의 기존 방법의 한계를 극복하기 위해.
  • DNA에서 표현형에 이르는 비대칭적이고 다단계의 생물학적 정보 흐름을 명시적으로 모델링하기 위해.
  • 사전 훈련과 미세조정을 통해 레이블이 없는 오미크스 데이터를 통합함으로써 정밀 옹호의 일반화 능력과 성능을 향상시키기 위해.
  • 구조적이고 계층적인 딥러닝 프레임워크를 사용하여 유전자형-표현형 모델링의 해석 가능성과 예측 정확도를 향상시키기 위해.

제안 방법

  • CLEIT는 고수준 도메인(예: 유전자 발현)과 저수준 도메인(예: 체세포 돌연변이)을 가진 크로스레벨 아키텍처를 사용하며, 고수준에서 저수준으로의 정보 전달를 모델링한다.
  • 낮은 수준의 표현을 고수준 특징의 잠재 표현과 정렬하기 위해 대조 손실을 사용하여, 더 구분력 있는 레이어로부터 지식 전이를 가능하게 한다.
  • 고수준 특징을 소스 도메인으로, 저수준 특징을 타겟 도메인으로 간주함으로써 도메인 적응 원리를 적용한다.
  • 사전 훈련-미세조정 전략을 적용한다: 일반적인 표현을 학습하기 위해 레이블이 없는 이질적인 오미크스 데이터에서 사전 훈련을 수행한 후, 레이블이 있는 약물 반응 데이터에서 미세조정을 수행한다.
  • 엔코더 및 디코더 헤드에서 SELU 활성화 함수, 배치 정규화, 드롭아웃을 사용하며, 약물 반응 예측을 위한 공통의 회귀기 헤드를 사용한다.
  • 송신기 모듈은 저수준 특징을 고수준 잠재 공간으로 매핑하는 데 학습하여 생물학적 수준 간의 구조적인 정보 흐름을 가능하게 한다.

실험 결과

연구 질문

  • RQ1고유의 유전자 발현과 같은 고수준 오미크스 정보를 활용하여, 체세포 돌연변이 데이터만으로도 암세포의 항암제 민감도를 효과적으로 예측할 수 있는가?
  • RQ2DNA → RNA → 단백질 → 표현형의 생물학적 수준 간의 비대칭적 정보 흐름을 모델링할 경우, 대칭적 또는 평면적인 아키텍처에 비해 유전자형-표현형 예측 성능이 어떻게 향상되는가?
  • RQ3낮은 수준과 고수준 표현 간의 정렬을 위해 대조 손실이 MMD, WGAN 등 다른 도메인 적응 손실보다 얼마나 뛰어나게 성능을 향상시키는가?
  • RQ4레이블이 없는 오미크스 데이터에서의 사전 훈련이 낮은 데이터 환경에서 모델의 일반화 능력과 성능을 얼마나 향상시키는가?
  • RQ5CLEIT 프레임워크는 환자의 돌연변이 프로파일만으로도 새로운 암 환자에게 상위 랭킹의 치료법을 추천하는 데 사용될 수 있는가?

주요 결과

  • CLEIT는 모든 베이스라인 모델보다 암세포의 항암제 민감도 예측에서 뚜렷한 승리를 거두었으며, 최고의 SOTA 모델인 DSN 대비 약물별 피어슨 상관계수에서 13.3% 향상되었다.
  • 대조 손실을 사용한 CLEIT 모델이 MMD 및 WGAN 기반 변종보다 높은 성능을 기록하여, 크로스레벨 표현 학습에서 대조 정렬의 우수성을 입증하였다.
  • 상위-k 랭크된 치료법을 예측할 때, CLEIT는 k=5에서 두 번째로 좋은 모델(DSN) 대비 약 5%의 정밀도 향상을 기록하여 정밀의학 분야에서 강력한 실용적 유용성을 보였다.
  • 절단 실험 결과, MLP 기반의 전송 함수와 사전 훈련이 성능 향상에 핵심적임을 확인하였으며, 이를 제거할 경우 정확도가 크게 떨어졌다.
  • 모델의 성능는 약물별 및 샘플별 평가 지표 모두에서 뛰어난 일반화 능력을 보였으며, 새로운 환자 데이터에 대한 일반화 능력을 검증하였다.
  • 사전 훈련을 통해 레이블이 없는 오미크스 데이터를 효과적으로 활용함으로써, 레이블이 제한된 약물 반응 데이터에서도 표현 학습 능력이 향상됨을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.