Skip to main content
QUICK REVIEW

[論文レビュー] Message Passing Networks for Molecules with Tetrahedral Chirality

Lagnajit Pattanaik, Octavian-Eugen Ganea|arXiv (Cornell University)|Nov 24, 2020
Computational Drug Discovery Methods参考文献 33被引用数 16
ひとこと要約

本稿では、標準的な和集合関数(sum)が果たせない、四面体キラリティを持つ分子を区別できるように、MPNNにおける非対称アグリゲーション関数としてPD(順列依存)およびPERM_CAT(順列・カテゴリ)の2つの新規関数を提案する。これらの手法は、キラリティに配慮したアグリゲーションにより、立体化学的差異を有する新しいタンパク質リガンドドッキングデータセットで性能向上を示し、ベースラインMPNNを上回る特性予測性能を実現した。

ABSTRACT

Molecules with identical graph connectivity can exhibit different physical and biological properties if they exhibit stereochemistry-a spatial structural characteristic. However, modern neural architectures designed for learning structure-property relationships from molecular structures treat molecules as graph-structured data and therefore are invariant to stereochemistry. Here, we develop two custom aggregation functions for message passing neural networks to learn properties of molecules with tetrahedral chirality, one common form of stereochemistry. We evaluate performance on synthetic data as well as a newly-proposed protein-ligand docking dataset with relevance to drug discovery. Results show modest improvements over a baseline sum aggregator, highlighting opportunities for further architecture development.

研究の動機と目的

  • 標準的なMPNNが対称的アグリゲーション関数のため、エナンチオマーを区別できないという限界を解消すること。
  • 物理的不変性を保ちつつキラリティ情報の保持を可能にするアグリゲーション関数の開発。
  • 分子特性の差が直接的に立体配置に起因する新しいベンチマークデータセットの構築。
  • 合成および実世界のドラッグディスカバリーデータセット上で、提案手法の実験的評価。

提案手法

  • 原子ごとに隣接エッジを順序付けたグラフ表現を設計し、非対称アグリゲーションを可能にする。
  • PDアグリゲーターを提案。相対的な原子順序に基づいて、隣接ノードの寄与度に学習可能な置換行列を適用する。
  • PERM_CATアグリゲーターを導入。各隣接順列に対して分類埋め込みを学習し、キラル配置の離散的かつ学習可能な区別を可能にする。
  • PyTorch Geometricフレームワーク内に実装し、合成および実世界のデータセットで学習を実施。
  • ノード表現を強化するために、局所的(LCF)、グローバル的(GCF)、およびボンド数(BCF)特徴量を組み合わせる。
  • エネルギー差に応じた立体異性体ペアの性能評価に、RMSEおよびランク分類精度を用いる。

実験結果

リサーチクエスチョン

  • RQ1MPNNにおける非対称アグリゲーション関数は、位相的に同一だが空間的に異なる四面体キラリティを持つ分子を効果的に区別できるか?
  • RQ2PDおよびPERM_CATアグリゲーターは、立体化学に依存する特性予測において、標準的な和集合(SUM)と比較して優れた性能を示すか?
  • RQ3タンパク質リガンド結合における既知の立体化学的差異を有するベンチマークデータセットにおいて、アグリゲーションプロセスに立体化学的情報を組み込むことで性能向上が見られるか?
  • RQ4提案手法は、GCN、GIN、DMPNNなどの異なるMPNNアーキテクチャに一般化できるか?
  • RQ5データにキラル中心が明示的にラベル付けされていなくても、モデルは意味のある立体化学的表現を学習できるか?

主な発見

  • PERM_CATアグリゲーターは、すべてのグラフアーキテクチャで最高のランク分類精度を達成し、ベースラインのSUMおよび他のアグリゲーターを一貫して上回った。
  • タンパク質リガンドドッキングデータセットにおいて、DMPNNアーキテクチャでPERM_CATはRMSEを最大0.27低下させ、回帰性能の向上を示した。
  • ランク分類において、DMPNNアーキテクチャでエネルギー差が5 kcal/molを超える場合、PERM_CATは62%を超える精度を達成した。
  • PDアグリゲーターは、SUM(50.0%)と比較してランク分類精度が向上(57.3%)したが、RMSEは高かったため、絶対値ではなく相対順序の把握に優れていると示唆された。
  • 立体異性体ペアを含まない標準的なMoleculeNetのリポフィリシティデータセットでは、すべてのカスタムアグリゲーターがSUMと同等の性能を示した。これは、キラリティ情報が存在する場合にのみ性能向上が見られることを確認した。
  • ドッキングデータセット全体で最も優れた性能を示したのはPERM_CAT(BCF)で、DMPNNアーキテクチャにおいてRMSEが6.35 ± 0.03(SUM:6.64 ± 0.05)を記録し、ベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。