[論文レビュー] MolE: a molecular foundation model for drug discovery
MolE は、原子環境をトークンとして用いることで、分子グラフから直接分子表現を学ぶ DeBERTa をベースにしたトランスフォーマー・アーキテクチャを採用した分子基礎モデルである。化学構造における自己教師あり事前学習と生物学的性質におけるマルチタスク教師あり事前学習を組み合わせることで、Therapeutic Data Commons ベンチマークの 22 個の ADMET タスクのうち 9 個で最先端の性能を達成した。
Models that accurately predict properties based on chemical structure are valuable tools in drug discovery. However, for many properties, public and private training sets are typically small, and it is difficult for the models to generalize well outside of the training data. Recently, large language models have addressed this problem by using self-supervised pretraining on large unlabeled datasets, followed by fine-tuning on smaller, labeled datasets. In this paper, we report MolE, a molecular foundation model that adapts the DeBERTa architecture to be used on molecular graphs together with a two-step pretraining strategy. The first step of pretraining is a self-supervised approach focused on learning chemical structures, and the second step is a massive multi-task approach to learn biological information. We show that fine-tuning pretrained MolE achieves state-of-the-art results on 9 of the 22 ADMET tasks included in the Therapeutic Data Commons.
研究の動機と目的
- 大規模なラベルなし分子データで事前学習された基礎モデルを用いることで、分子性質予測におけるラベル付きデータの限界を克服すること。
- 化学的構造と生物学的性質の両方から強固な分子表現を学習することで、ドラッグディスカバリにおける一般化性能を向上させること。
- 特にトランスフォーマー・アーキテクチャ(DeBERTa など)を用いた自然言語処理技術を、原子環境をトークンとして用いる分子グラフに適応すること。
- 2段階の事前学習戦略(分子構造における自己教師あり学習に続く生物学的性質におけるマルチタスク学習)の有効性を評価すること。
- 原子環境に基づく表現が従来のフィンガープint より優れており、ラベル付き小規模データセットにおける微調整性能が向上することを示すこと。
提案手法
- MolE は、中心原子とその直近の周囲原子からなる原子環境をトークンとして用い、分子グラフを順序付き入力として処理可能にする。
- モデルは、DeBERTa に由来する分離されたアテンション機構を採用し、分子グラフ内の原子間の相対的位置関係をモデル化する。
- 自己教師あり事前学習では、低い半径(例:半径 0)の原子環境から高い半径(例:半径 2)の原子環境を予測することで、内在する化学的トポロジーを学習する。
- その後、広範な生物学的および物理化学的性質を用いてマルチタスク教師あり事前学習を実施し、分子表現を機能的関連性に一致させる。
- 微調整段階では、ラベル付き小規模データセットを用いて下流の ADMET 予測タスクに適用し、事前学習済みモデルの汎用的表現を活用する。
- 2 種類のバリエーションを評価:原子環境(AtomEnvs)を用いるものと機能的環境(FunctionalEnvs)を用いるもので、補助損失のアブレーションスタディも実施。
実験結果
リサーチクエスチョン
- RQ1トランスフォーマーに基づくモデルが、原子環境をトークンとして用いることで、分子グラフから直接分子表現を効果的に学習できるか?
- RQ22 段階の事前学習戦略(構造における自己教師あり学習に続く生物学的性質におけるマルチタスク学習)が、小規模データの ADMET タスクにおける下流性能を向上させるか?
- RQ3機能的環境(要するに抽象化された化学的官能基)を用いる場合と原子環境を用いる場合とを比較した場合、モデルの一般化性能および性能にどのような差が生じるか?
- RQ4事前学習段階で補助的な自己教師あり目的を導入することで、下流タスクにおけるモデル性能がさらに向上するか?
- RQ5MolE は、標準化された ADMET ベンチマークにおいて、既存の最先端モデルをどの程度上回るか?
主な発見
- MolE は、Therapeutic Data Commons ベンチマークの 22 個の ADMET タスクのうち 9 個で最先端の性能を達成し、既存のモデルを上回った。
- リポフィリシティ予測では、平均絶対誤差(MAE)が 0.469 ± 0.009 に達し、リーダーボードで最高のスコアを記録した。
- VDss タスクでは、スピアマン順位相関係数が 0.654 ± 0.031 に達し、1 位となり、前回の最良モデルを顕著に上回った。
- CYP2C9 抑制タスクでは、AUPRC が 0.801 ± 0.003 に達し、1 位となり、前回の最良モデルを顕著に上回った。
- 補助損失を用いた自己教師あり事前学習により、FunctionalEnvs バリエーションの性能が向上し、リーダーボードのモデルを 22 タスク中 4 個で上回った。
- 教師あり事前学習を適用した場合、微調整による性能が最良であったが、教師あり事前学習が既に適用されている状況では、自己教師あり段階での補助損失の追加は性能向上をもたらさなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。