[論文レビュー] Adaptive Invariance for Molecule Property Prediction
本稿では、架橋ガイド付きで継続的に調整される環境を用いて不変リスク最小化を拡張することで、不快な変動を強調・抑制する動的かつ変動可能な潜在表現を生成する、分子特性予測のための新規手法 Adaptive Invariance を提案する。この手法により、異種データ間での一般化性能が向上し、SARS-CoV-2抗ウイルス活性予測において、最先端手法比で相対的に16%のAUROC向上を達成した。また、SARS-CoV-1 や分子断片スクリーニングなど、限られた断片的なデータソースにおいても、トランスファー学習ベースラインを上回る性能を発揮した。
Effective property prediction methods can help accelerate the search for COVID-19 antivirals either through accurate in-silico screens or by effectively guiding on-going at-scale experimental efforts. However, existing prediction tools have limited ability to accommodate scarce or fragmented training data currently available. In this paper, we introduce a novel approach to learn predictors that can generalize or extrapolate beyond the heterogeneous data. Our method builds on and extends recently proposed invariant risk minimization, adaptively forcing the predictor to avoid nuisance variation. We achieve this by continually exercising and manipulating latent representations of molecules to highlight undesirable variation to the predictor. To test the method we use a combination of three data sources: SARS-CoV-2 antiviral screening data, molecular fragments that bind to SARS-CoV-2 main protease and large screening data for SARS-CoV-1. Our predictor outperforms state-of-the-art transfer learning methods by significant margin. We also report the top 20 predictions of our model on Broad drug repurposing hub.
研究の動機と目的
- 訓練データが限られ、断片的であるか、あるいは異なる化学的空間やウイルス標的から得られている場合に、分子特性予測の外挿をどのように達成するかという課題に対処すること。
- スケルトンの違いや分子断片のサイズといった不快な変動への不変性を強制することで、分子特性予測の一般化性能を向上させること。
- 静的ドメイン分割に依存せず、潜在表現から進化する環境を生成する動的かつ適応的な不変リスク最小化(IRM)の変種を開発すること。
- 実世界の SARS-CoV-2 抗ウイルススクリーニングデータ(断片や SARS-CoV-1 データを含む)を用いて、本手法の妥当性と外挿能力を評価すること。
提案手法
- 本手法は、同じ訓練化合物に対して、スケルトン分類器を用いて潜在表現に継続的に調整された摂動を加えることで、2つの動的環境を定義する。
- 摂動は、潜在表現をより一般的で共通の特徴へと押し上げるように設計されており、予測器が無視すべき不快な変動を強調する。
- スケルトン分類器を用いて摂動プロセスをガイドすることで、モデルが標的特性とは関係のないスケルトン固有のパターンを無視するよう学習する。
- 動的に定義された環境間で予測器が不変であるよう促す、変更された不変リスク最小化の目的関数を用いてモデルを訓練する。
- SARS-CoV-2 全分子、SARS-CoV-2 断片、SARS-CoV-1 スクリーニングデータの複数のデータソースを統合的に統合した訓練フレームワークを採用する。
- 10 フォールド交差検証で訓練された 10 個のモデルのアンサンブルを用い、Broad Drug Repurposing Hub の特性予測を実施し、最終的なスコアはモデル間で平均化する。
実験結果
リサーチクエスチョン
- RQ1断片や SARS-CoV-1 といった異なるソースからの限られた、異種のデータで学習した機械学習モデルが、SARS-CoV-2 抗ウイルス活性を予測する能力を発揮できるか。
- RQ2不変リスク最小化を、スケルトンのような組み合わせ的に複雑で分子特有の記述子を、動的かつデータ駆動的に処理する方法にどのように適合できるか。
- RQ3潜在空間における動的環境生成が、標準的なドメイン適応やトランスファー学習を上回るモデルの頑健性と外挿能力をどの程度向上できるか。
- RQ4スケルトンレベルの変動に対する不変性を強制することで、ラベル付きデータが限られた下流の特性予測タスクで性能が向上するか。
主な発見
- 提案手法は、SARS-CoV-2 抗ウイルス活性予測で 0.8930 の AUROC スコアを達成し、最良のベースライン手法比で 8–16% の相対的向上を示した。
- Mpro阻害タスクでは、AUROC が 0.7955 に達し、次善の手法(0.7841)を顕著に上回り、異なるデータソース間での強力な一般化性能を示した。
- ドメインアダプティブトレーニング(DANN)や標準的な IRM よりも優れた性能を示し、抗ウイルス予測で AUROC 0.8146 を達成(DANN は 0.8067)。
- アブレーションスタディの結果、SARS-CoV-1 データを用いた学習は、SARS-CoV-2 データでのみ学習した場合(AUROC 0.7404)と比較して、SARS-CoV-2 抗ウイルス予測性能を向上させた(AUROC 0.8067)。これは、異なるウイルス間の関連性が確認された。
- 本手法は、SARS-CoV-2 に対するリプロポージングの可能性が 20 個の候補を同定した。その中には、C[C@]12CC(=O)[C@H]3[C@@H](CCC4=CC(=O)CC[C@]34C)[C@@H]1CC[C@]2(O)C(=O)CO といった化合物も含まれており、予測された抗ウイルス活性スコアは 0.955 であった。
- 結果から、潜在空間における適応的かつ動的な環境生成が、不快な変動を効果的に抑制し、低データ環境における分子特性予測の頑健な外挿を可能にすることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。