Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Invariance for Molecule Property Prediction

Wengong Jin, Regina Barzilay|arXiv (Cornell University)|2020. 05. 05.
COVID-19 diagnosis using AI참고 문헌 10인용 수 4
한 줄 요약

이 논문은 이질적인 데이터 간의 일반화를 향상시키기 위해 위험 요소 변동성을 강조하고 억제하기 위해 동적으로 변형된 잠재 표현을 생성하는 새로운 방법인 Adaptive Invariance를 제안한다. 구조 지도 기반으로 지속적으로 조정되는 환경를 활용해 불변 위험 최소화를 개선함으로써, SARS-CoV-2 항바이러스 활성 예측에서 최신 기법 대비 16% 상대적 AUROC 향상을 달성했으며, SARS-CoV-1 및 분자의 조각 스크리닝 데이터와 같은 제한적이고 분절된 데이터 소스에서 전이 학습 기반선보다 뛰어난 성능을 보였다.

ABSTRACT

Effective property prediction methods can help accelerate the search for COVID-19 antivirals either through accurate in-silico screens or by effectively guiding on-going at-scale experimental efforts. However, existing prediction tools have limited ability to accommodate scarce or fragmented training data currently available. In this paper, we introduce a novel approach to learn predictors that can generalize or extrapolate beyond the heterogeneous data. Our method builds on and extends recently proposed invariant risk minimization, adaptively forcing the predictor to avoid nuisance variation. We achieve this by continually exercising and manipulating latent representations of molecules to highlight undesirable variation to the predictor. To test the method we use a combination of three data sources: SARS-CoV-2 antiviral screening data, molecular fragments that bind to SARS-CoV-2 main protease and large screening data for SARS-CoV-1. Our predictor outperforms state-of-the-art transfer learning methods by significant margin. We also report the top 20 predictions of our model on Broad drug repurposing hub.

연구 동기 및 목표

  • 학습 데이터가 부족하거나 분절되어 있거나, 서로 다른 화학적 공간 또는 바이러스 표적에서 유래한 경우 분자 성질 예측을 외삽하는 데 도전하는 데 목적을 두며.
  • 스케일드 차이 또는 분자의 조각 크기와 같은 위험 요소 변동성에 대한 불변성을 강제하여 분자 성질 예측의 일반화 능력을 향상시키는 데 목적을 두며.
  • 고정된 도메인 분할에 의존하지 않고, 잠재 표현에서 변화하는 환경를 생성하는 동적이고 적응형 불변 위험 최소화(IRM)의 변형을 개발하는 데 목적을 두며.
  • 실제 SARS-CoV-2 항바이러스 스크리닝 데이터(조각 및 SARS-CoV-1 데이터 포함)를 대상으로 방법을 평가하여, 강인성과 외삽 능력을 입증하는 데 목적을 두며.

제안 방법

  • 이 방법은 동일한 학습 화합물에 대해 스케일드 분류기로 유도된 지속적으로 조정되는 변형을 통해 잠재 표현에 적용되는 두 개의 동적 환경을 도입한다.
  • 변형은 잠재 표현을 더 일반적이고 공통적인 특징으로 이동시키도록 설계되어, 예측기가 무시해야 할 위험 요소 변동성을 강조한다.
  • 스케일드 분류기는 변형 과정을 안내하여, 예측기의 성능에 기여하지 않는 스케일드 특성 패턴을 무시하도록 모델을 학습시킨다.
  • 이러한 동적으로 정의된 환경 간의 불변성을 장려하기 위해 수정된 불변 위험 최소화 목표 함수를 사용하여 모델을 학습시킨다.
  • SARS-CoV-2 전체 분자, SARS-CoV-2 조각, SARS-CoV-1 스크리닝 데이터를 포함한 다중 소스 데이터를 통합된 학습 프레임워크에 통합한다.
  • 10개의 모델을 10겹 교차 검증 하에 학습시켜 브로드 약물 재활용 허브의 성질을 예측하며, 최종 점수는 모델 간 평균을 내어 도출한다.

실험 결과

연구 질문

  • RQ1SARS-CoV-2 항바이러스 활성 예측을 위해, 조각 및 SARS-CoV-1와 같은 다양한 소스에서 온 제한적이고 이질적인 데이터로 학습된 기계 학습 모델이 일반화할 수 있는가?
  • RQ2불변 위험 최소화는 스케일드와 같은 조합적으로 복잡한 분자 특성에 대해 동적으로 데이터 기반 방식으로 어떻게 적응시킬 수 있는가?
  • RQ3잠재 공간에서의 동적 환경 생성은 표준 도메인 적응 또는 전이 학습을 초월해 모델의 강인성과 외삽 능력을 얼마나 향상시킬 수 있는가?
  • RQ4스케일드 수준의 변동성에 대한 불변성을 강제하면, 레이블이 제한된 데이터로 하류 성질 예측 작업에서 더 나은 성능을 낼 수 있는가?

주요 결과

  • 제안된 방법은 SARS-CoV-2 항바이러스 활성 예측에서 0.8930 AUROC 점수를 기록하여, 최고의 베이스라인 방법 대비 8–16% 상대적 향상을 달성했다.
  • Mpro 억제 과제에서 모델은 0.7955 AUROC를 기록하여 다음으로 좋은 방법(0.7841)보다 뚜렷이 뛰어나며, 다양한 데이터 소스 간의 강력한 일반화 능력을 보였다.
  • 도메인 적대적 훈련(DANN)과 표준 IRM보다 우수한 성능을 보였으며, 항바이러스 예측에서 AUROC 0.8146을 기록하여 DANN의 0.8067보다 높았다.
  • 제거 분석 결과, SARS-CoV-1 데이터로 학습한 경우 SARS-CoV-2 항바이러스 예측 성능(0.8067 AUROC)이 SARS-CoV-2 데이터로만 학습한 경우(0.7404 AUROC)보다 향상되었으며, 이는 바이러스 간 유사성의 확인이다.
  • 모델은 SARS-CoV-2에 대한 20개의 높은 잠재력 있는 재활용 후보를 식별했으며, C[C@]12CC(=O)[C@H]3[C@@H](CCC4=CC(=O)CC[C@]34C)[C@@H]1CC[C@]2(O)C(=O)CO와 같은 화합물은 예측 항바이러스 활성 점수 0.955를 기록했다.
  • 결과는 잠재 공간에서의 적응형 동적 환경 생성이 위험 요소 변동성을 효과적으로 억제하고, 저자료 분자 성질 예측에서 강인한 외삽을 가능하게 한다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.