Skip to main content
QUICK REVIEW

[論文レビュー] Ligandformer: A Graph Neural Network for Predicting Compound Property with Robust Interpretation

Jinjiang Guo, Qi Liu|arXiv (Cornell University)|Feb 21, 2022
Computational Drug Discovery Methods被引用数 7
ひとこと要約

Ligandformer は、構造的に関連する分子フラグメントを強調するロバストで解釈可能な注意マップを提供する、マルチレイヤー自己注意グラフニューラルネットワークであり、SAMPN や MPNN よりも精度が高く(AUROC 最大 0.98)、ブロック間の注意係数を統合することで、トレーニングラウンドにわたる予測安定性を確保している。

ABSTRACT

Robust and efficient interpretation of QSAR methods is quite useful to validate AI prediction rationales with subjective opinion (chemist or biologist expertise), understand sophisticated chemical or biological process mechanisms, and provide heuristic ideas for structure optimization in pharmaceutical industry. For this purpose, we construct a multi-layer self-attention based Graph Neural Network framework, namely Ligandformer, for predicting compound property with interpretation. Ligandformer integrates attention maps on compound structure from different network blocks. The integrated attention map reflects the machine's local interest on compound structure, and indicates the relationship between predicted compound property and its structure. This work mainly contributes to three aspects: 1. Ligandformer directly opens the black-box of deep learning methods, providing local prediction rationales on chemical structures. 2. Ligandformer gives robust prediction in different experimental rounds, overcoming the ubiquitous prediction instability of deep learning methods. 3. Ligandformer can be generalized to predict different chemical or biological properties with high performance. Furthermore, Ligandformer can simultaneously output specific property score and visible attention map on structure, which can support researchers to investigate chemical or biological property and optimize structure efficiently. Our framework outperforms over counterparts in terms of accuracy, robustness and generalization, and can be applied in complex system study.

研究の動機と目的

  • QSARにおけるディープラーニングモデルのブラックボックス性に対処し、分子構造の局所的で解釈可能な予測根拠を可能にすること。
  • ディープラーニングモデルに一般的に見られる不安定性を克服し、トレーニングラウンドにわたる予測のロバスト性を向上させること。
  • 多様な化学的・生物学的特性を高い性能で予測できる汎用性の高いフレームワークを開発すること。
  • 複数のネットワークブロックにわたる注意機構を統合し、分子サブ構造に対する機械の関心を反映する安定的で解釈可能な注意マップを生成すること。

提案手法

  • Ligandformer は、7つの原子属性を初期ノード特徴量として用いる双方向 2D 分子グラフ表現を採用する。
  • クエリ、キー、バリューの変換に基づくマルチレイヤー自己注意機構を適用し、原子間の注意スコアを学習する。
  • 各ブロックの注意マップは、ドット積注意のソフトマックスによって計算される:$ Y_h = \text{softmax}(Q_h K_h^T) V_h $。
  • すべてのブロックからの注意係数を平均化して統合注意マップを生成し、ロバスト性と解釈可能性を向上させる。
  • Adam 最適化手法を用い、学習率 0.001、重み減衰 0.0001 を設定し、AUROC に 50 エポックの改善が見られない場合に早期停止を適用する。
  • SMILES 文字列は RDKit を用いて分子グラフに変換され、DeepChem/Chemprop パイプラインを介して一貫した入力表現が得られる。

実験結果

リサーチクエスチョン

  • RQ1GNN ベースのモデルは、特定の分子サブ構造が特性予測に与える影響を強調する、安定的で解釈可能な注意マップを提供できるか?
  • RQ2複数のネットワークブロックにわたる注意係数の統合は、単一モデルや非統合注意アプローチと比較して、予測の安定性をどのように向上させるか?
  • RQ3Ligandformer は、高い精度と解釈可能性を維持しながら、さまざまな化学的・生物学的特性にどれほど一般化可能か?
  • RQ4Ligandformer が生成する注意マップは、専門家の化学的直観と一致するか。これにより、ドラッグディスカバリにおける構造ベースの最適化が可能になるか?

主な発見

  • Ligandformer は水中溶解度において AUROC 0.98 を達成し、MPNN(0.93)および SAMPN(0.92)を上回った。
  • Caco-2 細胞透過性に関しては、Ligandformer は AUROC 0.89 を維持し、SAMPN と同等であったが、MPNN(0.89)を上回った。
  • アーメス変異原性に関しては、Ligandformer が AUROC 0.92 を達成し、MPNN(0.90)および SAMPN(0.91)を上回った。
  • 異なるランダム初期化のもとでも、Ligandformer の統合注意マップは2回のトレーニングラウンドにわたって一貫性を示し、安定性を裏付けた。
  • 注意マップの可視化から、深層のブロックがより大きな分子フラグメントを強調しているのに対し、浅層のブロックは個々の原子や局所的な機能性基団に注目していることが明らかになった。
  • マルチスケールの注意係数の統合は、非統合注意機構と比較して、モデルの安定性と解釈可能性を顕著に向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。