Skip to main content
QUICK REVIEW

[論文レビュー] Graph Polish: A Novel Graph Generation Paradigm for Molecular Optimization

Chaojie Ji, Yijia Zheng|arXiv (Cornell University)|Aug 14, 2020
Computational Drug Discovery Methods参考文献 52被引用数 4
ひとこと要約

本稿では、グラフ生成を「二言語翻訳」ではなく「一言語の磨き上げ」として再定式化する、新しい分子最適化パラダイム「Graph Polish」を紹介する。これにより、段階的で誤りを伴いやすい部分構造の追加が軽減される。T&S polishフレームワークは最適化中心を特定し、保持領域を最大化し、変更を最小限に抑える。4つのベンチマークデータセットで最先端の性能を達成し、COREの学習時間の2.3%で実現。解釈可能性と効率性の両面で優れた結果を示した。

ABSTRACT

Molecular optimization, which transforms a given input molecule X into another Y with desirable properties, is essential in molecular drug discovery. The traditional translating approaches, generating the molecular graphs from scratch by adding some substructures piece by piece, prone to error because of the large set of candidate substructures in a large number of steps to the final target. In this study, we present a novel molecular optimization paradigm, Graph Polish, which changes molecular optimization from the traditional "two-language translating" task into a "single-language polishing" task. The key to this optimization paradigm is to find an optimization center subject to the conditions that the preserved areas around it ought to be maximized and thereafter the removed and added regions should be minimized. We then propose an effective and efficient learning framework T&S polish to capture the long-term dependencies in the optimization steps. The T component automatically identifies and annotates the optimization centers and the preservation, removal and addition of some parts of the molecule, and the S component learns these behaviors and applies these actions to a new molecule. Furthermore, the proposed paradigm can offer an intuitive interpretation for each molecular optimization result. Experiments with multiple optimization tasks are conducted on four benchmark datasets. The proposed T&S polish approach achieves significant advantage over the five state-of-the-art baseline methods on all the tasks. In addition, extensive studies are conducted to validate the effectiveness, explainability and time saving of the novel optimization paradigm.

研究の動機と目的

  • 分子最適化のための従来のグラフからグラフへの翻訳手法における非効率性と誤りの蓄積を是正すること。この手法は、元から部分構造を段階的に追加することで標的分子を生成する。
  • 最適化中に元の分子の保持領域を最大化することで、生成ステップ数と誤り伝搬を低減すること。
  • 長期的な依存関係を捉える学習フレームワークを構築し、最適化意思決定の直感的な解釈を可能にすること。
  • 既存の最先端手法と比較して、分子最適化タスクにおいて優れた性能、時間効率、説明可能性を達成すること。

提案手法

  • Graph Polishパラダイムは、分子最適化を「磨き上げ」タスクとして再定式化し、分子の小さな最適化領域のみを変更する。これにより、完全に新しい標的を生成するのではなく、元の構造をベースに最適化を行う。
  • T部は最適化中心を自動的に特定し、構造的・特性的制約に基づいて分子領域を保持領域、削除領域、追加領域に分類する。
  • S部はT部のアノテーションから変換パターンを学習し、アテンション機構を備えたシーケンス・ツー・シーケンス生成メカニズムを用いて最終的な最適化分子を生成する。
  • フレームワークは分子部分構造をモデル化するためにジャンクションツリー表現を用い、最適化プロセスにおける長距離依存関係を捉えるためにマスク付き自己注意機構を適用する。
  • 最適化中心は、有害な官能基(例:毒性アラート)に近い原子を優先する学習スコアに基づいて選択され、有益な部分構造の損失を最小限に抑える。
  • 検証のためSMILESおよびSMARTS表現を統合し、構造的アラートの正確な検出と合理的な最適化化合物の生成を可能にする。

実験結果

リサーチクエスチョン

  • RQ1構造的変更を最小限に抑える「磨き上げ」パラダイムが、従来の「翻訳」手法を上回る性能を発揮できるか?
  • RQ2二段階のT&S polishフレームワークは、最適な変更中心を効果的に特定し、有益な部分構造を保持できるか?
  • RQ3Graph Polishパラダイムは、最先端手法と比較して、学習時間の短縮とサンプル効率の向上をどの程度達成できるか?
  • RQ4モデルの最適化意思決定は、構造的分析とアラート検出を通じて直感的に解釈可能かつ検証可能か?

主な発見

  • T&S polishは、QEDやLogPを含む複数の最適化指標において、4つのベンチマークデータセットで5つの最先端ベースライン手法を上回る顕著な性能向上を達成した。
  • 学習時間は1エポックあたりたったの21分にまで短縮され、これはCOREの学習時間の約2.3%であり、LogP6データセットではVJTNNの14.8%に相当する。
  • T部は1エポックあたり約9〜10分で最適化中心予測を実行し、計算オーバーヘッドが非常に低いことが示された。
  • モデルは一貫して毒性アラート構造に近い原子を最適化中心として選択しており、ほとんどの場合で上位5つの確率が0.8を超えるなど、高い信頼性と合理的な意思決定を示した。
  • フレームワークは非常に解釈可能な結果を生成し、保持領域が明確に非毒性で有益な部分構造と一致しており、変更は標的の官能基除去に集中していた。
  • 広範なアブレーションスタディにより、保持領域を最大化することが最適化成功率の向上と誤り伝搬の低減に顕著に寄与することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。