[論文レビュー] Drug Discovery under Covariate Shift with Domain-Informed Prior Distributions over Functions
本論文では、薬物様化学的空間のドメイン固有の事前知識を関数上の事前分布としてエンコードすることで、分布シフト下での薬物発見を改善する確率的深層学習フレームワーク、q-saviを紹介する。文脈に適応した事前分布でニューラルネットワークを正則化する変分推論を用いることで、q-saviは、分布外の化合物に対して、最先端の自己教師あり学習およびドメイン適応手法と比較して、顕著に優れた予測精度と不確実性のキャリブレーションを達成する。
Accelerating the discovery of novel and more effective therapeutics is an important pharmaceutical problem in which deep learning is playing an increasingly significant role. However, real-world drug discovery tasks are often characterized by a scarcity of labeled data and significant covariate shift$\unicode{x2013}\unicode{x2013}$a setting that poses a challenge to standard deep learning methods. In this paper, we present Q-SAVI, a probabilistic model able to address these challenges by encoding explicit prior knowledge of the data-generating process into a prior distribution over functions, presenting researchers with a transparent and probabilistically principled way to encode data-driven modeling preferences. Building on a novel, gold-standard bioactivity dataset that facilitates a meaningful comparison of models in an extrapolative regime, we explore different approaches to induce data shift and construct a challenging evaluation setup. We then demonstrate that using Q-SAVI to integrate contextualized prior knowledge of drug-like chemical space into the modeling process affords substantial gains in predictive accuracy and calibration, outperforming a broad range of state-of-the-art self-supervised pre-training and domain adaptation techniques.
研究の動機と目的
- ラベル付きデータが乏しく、分布外の化合物に対してしばしば失敗する、初期段階の薬物発見における共変量シフトの課題に対処すること。
- 薬物様化学的空間の明示的事前知識を深層学習モデルに組み込む、透明性があり確率的原理に基づいた手法を開発すること。
- 生物学的活性予測における現実的なデータシフトを模擬する、強力で外挿的評価設定を構築すること。
- 強い分布シフト下での予測性能とキャリブレーションにおいて、既存の自己教師あり事前学習、ドメイン適応、アンサンブル手法を上回ること。
- 新規で構造的に異なる化合物に対する信頼性の高い不確実性評価を可能にすること—これは、薬物発見における実験的検証の誘導に不可欠である。
提案手法
- q-saviは、高品質で事前処理済みの生物学的活性データセットから得られる文脈ポイントの分布を定義することで、関数上に事前分布を定義する。
- 問題に適合した事前分布で仮説空間を正則化する変分推論を用いてニューラルネットワークを学習することで、ドメイン知識をモデルのインダクティブバイアスに効果的に埋め込む。
- モデルの予測が既知の構造活性相関によって制約されるように、化学的空間の代表的サブセットから文脈ポイントをサンプリングして事前分布を情報化する。
- 分子量やスペクトルクラスタリングなどのドメイン固有の統計を用いて事前分布を構築し、トレーニング・テスト分割における意味のある共変量およびラベルシフトを誘導する。
- フレームワークは、データの不確実性とモデルの不確実性を分布シフト下で反映する予測分布をモデル化することで、不確実性の評価を可能にする。
- 研究者が化合物設計のための望ましい「エグジット・ベクトル」を明示的に指定できるようにすることで、アクティブラーニングと特性最適化を可能にする。
実験結果
リサーチクエスチョン
- RQ1薬物様化学的空間の明示的でドメインに適合した事前知識をエンコードすることで、低データかつ分布外の薬物発見設定における一般化性能が向上するか?
- RQ2q-saviが関数空間に事前分布を用いる方法は、自己教師あり事前学習およびドメイン適応と比較して、強い共変量シフトおよびラベルシフトに対処する上でどのように異なるか?
- RQ3確率的で事前分布に基づくアプローチは、外挿的化学的空間において、予測のキャリブレーションと不確実性推定をどの程度改善できるか?
- RQ4分子統計(例:分子量、スペクトルクラスタリング)から導出される文脈に適応した事前分布は、評価のためのより強固で意味のあるトレーニング・テスト分割を可能にするか?
- RQ5変分推論を介して事前知識を統合することで、新規で相違する構造の化合物に対する予測の過信を低減できるか?
主な発見
- q-saviは、自己教師あり事前学習、ドメイン適応、ディープアンサンブルを含むすべてのベースライン手法を、最も共変量およびラベルシフトが強いデータセット(HIVPROT、DPP4、NK1)で、統計的に有意な余裕をもって上回った。
- HIVPROTデータセットでは、q-saviは平均RMSE 0.682 ± 0.019を達成し、次に良いベースラインの0.712 ± 0.014と比較して顕著な改善を示した。
- DPP4データセットでは、q-saviはRMSE 0.664 ± 0.028を達成し、ベースライン手法(0.705 ± 0.015)よりも顕著に優れた性能を示した。
- NK1データセットでは、q-saviはRMSE 1.332 ± 0.017を達成し、次に良い手法(1.393 ± 0.024)を上回った。
- q-saviは、特に最も分布外の状態下で、低い予測不確実性のキャリブレーション誤差を示し、優れた不確実性キャリブレーションを実現した。
- 訓練データが著しくバイアスがかかっていても、q-saviは強い性能を維持し、分子量やスペクトルクラスタリングに基づく分割によって誘導される分布シフトに対して、頑健であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。