Skip to main content
QUICK REVIEW

[논문 리뷰] Drug Discovery under Covariate Shift with Domain-Informed Prior Distributions over Functions

Leo Klarner, Tim G. J. Rudner|arXiv (Cornell University)|2023. 07. 14.
Computational Drug Discovery MethodsComputer Science인용 수 3
한 줄 요약

이 논문은 약물 유사 화학적 공간의 도메인 특화 사전 지식을 함수에 대한 사전 분포로 표현함으로써, 공변량 이동 상황에서 약물 발굴을 향상시키는 확률적 딥러닝 프레임워크인 q-savi를 소개한다. 문맥 인식 사전 분포로 신경망을 정규화하기 위해 변분 추론을 사용함으로써, q-savi는 상태기반의 자기지도 학습 및 도메인 적응 방법보다 예측 정확도와 불확실성 캘리브레이션 측면에서 유의미하게 뛰어난 성능을 달성한다. 이는 분포를 벗어난 화합물에 대해 성능을 발휘한다.

ABSTRACT

Accelerating the discovery of novel and more effective therapeutics is an important pharmaceutical problem in which deep learning is playing an increasingly significant role. However, real-world drug discovery tasks are often characterized by a scarcity of labeled data and significant covariate shift$\unicode{x2013}\unicode{x2013}$a setting that poses a challenge to standard deep learning methods. In this paper, we present Q-SAVI, a probabilistic model able to address these challenges by encoding explicit prior knowledge of the data-generating process into a prior distribution over functions, presenting researchers with a transparent and probabilistically principled way to encode data-driven modeling preferences. Building on a novel, gold-standard bioactivity dataset that facilitates a meaningful comparison of models in an extrapolative regime, we explore different approaches to induce data shift and construct a challenging evaluation setup. We then demonstrate that using Q-SAVI to integrate contextualized prior knowledge of drug-like chemical space into the modeling process affords substantial gains in predictive accuracy and calibration, outperforming a broad range of state-of-the-art self-supervised pre-training and domain adaptation techniques.

연구 동기 및 목표

  • 라벨이 부족하고 모델이 분포를 벗어난 화합물에서 실패하는 초기 단계의 약물 발굴에서 공변량 이동 문제를 해결하기 위해.
  • 약물 유사 화학적 공간에 대한 명시적 사전 지식을 딥러닝 모델에 통합하는 투명하고 확률론적으로 타당한 방법을 개발하기 위해.
  • 실제 생물활성 예측에서의 데이터 이동을 현실적으로 시뮬레이션하는 강력한 외삽 평가 설정을 구축하기 위해.
  • 강한 분포 이동 상황에서 기존의 자기지도 사전 학습, 도메인 적응, 앙상블 방법보다 예측 성능과 캘리브레이션 측면에서 뛰어나지 않기 위해.
  • 신규이자 구조적으로 다를 수 있는 화합물에 대해 신뢰할 수 있는 불확실성 측정을 가능하게 하여, 약물 발굴에서 실험적 검증을 안내하는 데 핵심적이다.

제안 방법

  • q-savi는 고품질로 사전 처리된 생물활성 데이터셋에서 유도된 문맥 점 분포를 정의함으로써 함수에 대한 사전 분포를 정의한다.
  • 문제에 특화된 사전 분포로 신경망의 가설 공간을 정규화함으로써, 도메인 지식을 모델의 인덕티브 바이어스에 효과적으로 통합하는 변분 추론을 사용하여 신경망을 훈련한다.
  • 모델의 예측이 알려진 구조-활성 관계에 의해 제약을 받도록, 화학적 공간의 대표적 부분집합에서 문맥 점을 샘플링하여 사전을 구성한다.
  • 분포 이동을 유도하기 위해 분자량 및 스펙트럼 클러스터링과 같은 도메인 특화 통계를 사용하여 사전을 구성한다.
  • 분포 이동 상황에서 데이터 불확실성과 모델 불확실성을 반영하는 예측 분포를 모델링함으로써 불확실성 측정을 지원한다.
  • 연구자가 화합물 설계를 위해 바람직한 '종료 벡터'를 명시적으로 지정할 수 있도록 하여, 주도적 학습과 성능 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1약물 유사 화학적 공간에 대한 명시적 도메인 인식 사전 지식을 통합함으로써, 저데이터 및 분포를 벗어난 화합물이 있는 약물 발굴 환경에서 일반화 능력을 향상시킬 수 있는가?
  • RQ2q-savi의 함수 공간 사전 분포 사용 방식은 강한 공변량 이동 및 레이블 이동을 다룰 때 자기지도 사전 학습 및 도메인 적응 방법과 비교해 어떻게 다른가?
  • RQ3확률론적 사전 기반 접근 방식은 외삽 화학적 공간에서 예측 캘리브레이션과 불확실성 추정을 얼마나 향상시킬 수 있는가?
  • RQ4분자 통계(예: 분자량, 스펙트럼 클러스터링)에서 유도된 문맥 인식 사전 분포는 평가를 위한 더 강력하고 의미 있는 훈련-테스트 분할을 이끌 수 있는가?
  • RQ5변분 추론을 통해 사전 지식을 통합함으로써, 새로운 구조적 유사성이 없는 화합물에 대한 예측에서 과신의 위험을 줄일 수 있는가?

주요 결과

  • q-savi는 자기지도 사전 학습, 도메인 적응, 딥 앙상블을 포함한 모든 베이스라인 방법보다 공변량 이동과 레이블 이동이 심한 데이터셋(HIVPROT, DPP4, NK1)에서 통계적으로 유의미한 격차로 뛰어난 성능을 보였다.
  • HIVPROT 데이터셋에서 q-savi는 평균 RMSE 0.682 ± 0.019를 기록했으며, 이는 다음으로 우수한 베이스라인의 RMSE 0.712 ± 0.014보다 유의미하게 향상된 결과였다.
  • DPP4 데이터셋에서 q-savi는 RMSE 0.664 ± 0.028를 기록했으며, 베이스라인 방법(0.705 ± 0.015)보다 유의미하게 뛰어났다.
  • NK1 데이터셋에서 q-savi는 RMSE 1.332 ± 0.017를 기록했으며, 다음으로 우수한 방법(1.393 ± 0.024)을 압도했다.
  • q-savi는 모든 테스트 세트에서 더 낮은 예측 불확실성 캘리브레이션 오차를 보이며 뛰어난 불확실성 캘리브레이션 성능를 입증했으며, 특히 분포를 크게 이탈한 영역에서 두드러졌다.
  • 훈련 데이터가 매우 편향되어 있어도 q-savi는 강력한 성능 유지를 보였으며, 분자량 및 스펙트럼 클러스터링 기반 분할에 의해 유도된 분포 이동에 대해 뛰어난 내구성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.