[論文レビュー] CASTER: Predicting Drug Interactions with Chemical Substructure Representation
CASTER は、分子構造から導出された化学的サブストラクチャ表現を用いて、薬物同士の相互作用(DDI)を予測するディープラーニングフレームワークである。機能的サブストラクチャ抽出のための逐次パターンマイニング、ラベル付きおよびラベルなしデータを用いた一般化のためのオートエンコーディング、およびサブストラクチャに解釈可能な係数を割り当てるための辞書学習を組み合わせることで、精度と解釈可能性を向上させ、2つの実世界のDDIデータセットにおいて最先端のモデルを上回る性能を発揮している。
Adverse drug-drug interactions (DDIs) remain a leading cause of morbidity and mortality. Identifying potential DDIs during the drug design process is critical for patients and society. Although several computational models have been proposed for DDI prediction, there are still limitations: (1) specialized design of drug representation for DDI predictions is lacking; (2) predictions are based on limited labelled data and do not generalize well to unseen drugs or DDIs; and (3) models are characterized by a large number of parameters, thus are hard to interpret. In this work, we develop a ChemicAl SubstrucTurE Representation (CASTER) framework that predicts DDIs given chemical structures of drugs.CASTER aims to mitigate these limitations via (1) a sequential pattern mining module rooted in the DDI mechanism to efficiently characterize functional sub-structures of drugs; (2) an auto-encoding module that leverages both labelled and unlabelled chemical structure data to improve predictive accuracy and generalizability; and (3) a dictionary learning module that explains the prediction via a small set of coefficients which measure the relevance of each input sub-structures to the DDI outcome. We evaluated CASTER on two real-world DDI datasets and showed that it performed better than state-of-the-art baselines and provided interpretable predictions.
研究の動機と目的
- DDI予測に特化した薬物表現の不足に起因する、相互作用のメカニズムに不可欠な機能的サブス トラクチャを無視する傾向があることへの対処。
- ラベル付きおよびラベルなしの化学データ(薬物-食品相互作用を含む)を活用することで、未知の薬物ペアに対するモデルの一般化能力を向上させ、バイアスを低減し、性能を向上させる。
- 辞書学習モジュールを用いて、DDIの原因となる主要なサブス トラクチャを同定し、その重要度係数を割り当てることで、予測の解釈可能性を提供する。
- DDI予測におけるディープラーニングモデルのブラックボックス性を克服し、予測結果の人が読みやすい説明を可能にする。
提案手法
- SMILES形式の分子構造に基づき、既知のDDIメカニズムに裏付けられた機能的サブス トラクチャ(例:機能性基)を逐次パターンマイニングにより抽出する。
- ラベル付きおよびラベルなしの薬物ペアからなる埋め込み表現を学習するオートエンコーディングモジュールを採用し、表現の一般化能力を向上させる。
- 頻出サブス トラクチャで定義される部分空間に薬物ペアを射影するための辞書学習を適用し、サブス トラクチャのDDI結果に対する関連性を示すスパース係数を生成する。
- 係数を100倍するスケーリングを施すことで、収束を向上させる「拡大されたリッジ回帰層」を統合し、モデル挙動を変更せずに学習を高速化する。
- データ品質を確保するため、SMILES文字列をRDKitを用いて標準化し、処理不能なエントリをフィルタリングする。
- 複数のランダムシードを用いた5分割交差検証を実施し、評価の堅牢性を確保し、平均性能と標準偏差を報告する。
実験結果
リサーチクエスチョン
- RQ1全分子表現を用いるモデルと比較して、サブス トラクチャベースの表現フレームワークはDDI予測の精度を向上させるか?
- RQ2ラベルなしデータ(例:薬物-食品ペア)を統合することで、DDI予測モデルの一般化能力はどの程度向上するか?
- RQ3辞書学習モジュールは、DDIの原因となる化学的に意味のあるサブス トラクチャを明確に示す解釈可能なスパース係数を生成できるか?
- RQ4異なる初期化設定や多様なDDI事例において、解釈可能性の結果はどの程度頑健か?
- RQ5CASTERは、DeepDDI や mol2vec、molecular VAE といった最先端のモデルを、予測性能および解釈可能性の両面で上回るか?
主な発見
- Sildenafil–Isosorbide Mononitrate 相互作用に対して、CASTERは 0.7928 の信頼度スコアを達成し、知られている高リスクDDIであることを強く予測した。
- 硝酸エステル機能性基(O=[N+](O-))は、拡大後の係数が 8.25 と最も高く、既知の薬理学的メカニズムと整合した。
- 5種の硝酸エステル含有薬物における硝酸基の平均係数は、他のサブス トラクチャの平均値よりも50%高いことから、非ランダムで生物学的に妥当な関連性が裏付けられた。
- 異なるランダムシードを用いた5回の実行における係数相関行列の平均相関係数は 0.7673 であり、解釈可能性の安定性と頑健性が確認された。
- CASTERは、2つの実世界のDDIデータセットにおいて、DeepDDI や mol2vec、molecular VAE といった最先端のベースラインモデルを、予測精度の面で上回った。
- 外部知識を必要とせずに、ラベルなしの薬物-食品相互作用データを活用することで、表現学習の一般化能力が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。