Skip to main content
QUICK REVIEW

[論文レビュー] Discovering Molecular Functional Groups Using Graph Convolutional Neural Networks

Phillip B. Pope, Soheil Kolouri|arXiv (Cornell University)|Dec 1, 2018
Computational Drug Discovery Methods被引用数 12
ひとこと要約

本論文では、毒性や血脳関門透過性といった特定の化学的性質に関与する分子官能基を自動で同定するための、グラフ畳み込みニューラルネットワーク(GCNN)ベースのフレームワークを提案する。Grad-CAMは対照性が高く、正確な官能基の局在化を実現し、実験的検証を伴わずに既知および未知のサブストラクチャをデータ駆動で同定可能である。

ABSTRACT

Functional groups (FGs) are molecular substructures that are served as a foundation for analyzing and predicting chemical properties of molecules. Automatic discovery of FGs will impact various fields of research, including medicinal chemistry and material sciences, by reducing the amount of lab experiments required for discovery or synthesis of new molecules. In this paper, we investigate methods based on graph convolutional neural networks (GCNNs) for localizing FGs that contribute to specific chemical properties of interest. In our framework, molecules are modeled as undirected relational graphs with atoms as nodes and bonds as edges. Using this relational graph structure, we trained GCNNs in a supervised way on experimentally-validated molecular training sets to predict specific chemical properties, e.g., toxicity. Upon learning a GCNN, we analyzed its activation patterns to automatically identify FGs using four different explainability methods that we have developed: gradient-based saliency maps, Class Activation Mapping (CAM), gradient-weighted CAM (Grad-CAM), and Excitation Back-Propagation. Although these methods are originally derived for convolutional neural networks (CNNs), we adapt them to develop the corresponding suitable versions for GCNNs. We evaluated the contrastive power of these methods with respect to the specificity of the identified molecular substructures and their relevance for chemical functions. Grad-CAM had the highest contrastive power and generated qualitatively the best FGs. This work paves the way for automatic analysis and design of new molecules.

研究の動機と目的

  • 高価な実験的手順に依存せずに、データ駆動の方法で分子官能基の自動同定を実現すること。
  • 畳み込みニューラルネットワーク(CNN)で用いられる解釈可能性技術を、分子グラフに適用するグラフ畳み込みニューラルネットワーク(GCNN)に適応すること。
  • 特定の分子性質に寄与する化学的に関連するサブストラクチャを同定するために、複数の解釈可能性手法を評価・比較すること。
  • 化学およびドラッグデザイン分野における官能基同定の伝統的実験手法に対するスケーラブルで自動化された代替手法を提供すること。
  • モデルの解釈可能性を通じて、毒性や溶解度などの性質に影響を与える未知または既知の官能基を同定できること。

提案手法

  • 分子は原子をノード、結合をエッジとする非有向関係グラフとして表現される。
  • 毒性や血脳関門透過性などの特定の化学的性質を予測するために、実験的に検証済みの分子データセット上でGCNNを教師あり学習で訓練する。
  • 勾配ベースのサリエンシー地図、クラス活性化マッピング(CAM)、Grad-CAM、および活性化逆伝播(EB)の4つの解釈可能性手法をGCNNに適応し、関連する分子サブス トラクチャを局在化する。
  • これらの手法は予測への原子レベルの寄与度を強調する活性化マップを生成し、その後、繰り返し現れるサブス トラクチャを同定するために集約される。
  • サブス トラクチャは、比指標 $ R_e $ を用いて説明における頻度順にランク付けされ、化学的関連性を評価するために $ R_p $ を用いて既知の正例ラベルと比較される。
  • 忠実度、対照性、スパarsityの指標を用いてモデルの性能を評価し、説明の質と特異性を定量化する。

実験結果

リサーチクエスチョン

  • RQ1GCNNに適応された解釈可能性手法は、特定の化学的性質に寄与する分子サブス トラクチャを効果的に局在化できるか?
  • RQ2CAM、Grad-CAM、EB、またはc-EBのうち、どの4つの解釈可能性手法が、異なる分子性質に対して対照的かつ特異的なサブス トラクチャ説明を生成するか?
  • RQ3提案手法は、事前の化学的知識なしに、ハロゲン、アミド、芳香族環といった既知の官能基を自動で同定できるか?
  • RQ4忠実度、対照性、スパarsityの指標は、同定されたサブス トラクチャの解釈可能性および化学的関連性とどのように相関するか?
  • RQ5このフレームワークは、実験的に検証可能である可能性のある未知または関連性の高い官能基を同定できるか?

主な発見

  • Grad-CAMは、全データセットで対照性が最も高く、官能基の説明において質的にも最も優れた結果を示し、CAM、EB、c-EBを上回った。
  • 既知の官能基を正常に同定した:BBBPではCF3、BACEではアミド、TOX21では芳香族環。これにより化学的関連性が裏付けられた。
  • Grad-CAMの対照性スコアは、BBBPで0.01 ± 0.07、BACEで0.0 ± 0.0、TOX21で0.01 ± 0.11を記録し、サブス トラクチャ局在化の高精度性を示した。
  • c-EBは活性化が疎らであった(BBBPでスパarsity: 40.54 ± 21.69)が、過剰に疎らな出力のためベンゼン環全体を捉えられず、スパarsityと性能のトレードオフが示された。
  • Grad-CAMの忠実度スコアは、BBBPで41.06 ± 19.05、BACEで29.22 ± 14.04、TOX21で44.03 ± 23.7であり、予測結果に対する説明の妥当性が中程度から高い水準であることを示した。
  • 最も頻度の高い上位10のサブス トラクチャ($ R_e $ による順位付け)には、ハロゲンやアミドといった既知のフォーフォア(薬効基)が含まれており、生物学的に関連するパターンを回復できる能力が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。