Skip to main content
QUICK REVIEW

[論文レビュー] Do Deep Learning Methods Really Perform Better in Molecular Conformation Generation?

Gengmo Zhou, Zhifeng Gao|arXiv (Cornell University)|Feb 14, 2023
Computational Drug Discovery Methods被引用数 5
ひとこと要約

本稿では、RDKitのETKDGコンフォーマ生成と複数のサンプリング手法(一様、幾何学的、エネルギー基準)を組み合わせ、教師なしクラスタリングを用いて高品質な分子コンフォーマを生成する、単純でパラメータフリーなアルゴリズムを提案する。驚くべきことに、GEOM-QM9 や GEOM-Drugs といった標準ベンチマークにおいて、最先端の深層学習モデルを上回る性能を発揮し、分子コンフォーマ生成における深層学習の優位性が当然であるとされる仮定に疑問を呈する。

ABSTRACT

Molecular conformation generation (MCG) is a fundamental and important problem in drug discovery. Many traditional methods have been developed to solve the MCG problem, such as systematic searching, model-building, random searching, distance geometry, molecular dynamics, Monte Carlo methods, etc. However, they have some limitations depending on the molecular structures. Recently, there are plenty of deep learning based MCG methods, which claim they largely outperform the traditional methods. However, to our surprise, we design a simple and cheap algorithm (parameter-free) based on the traditional methods and find it is comparable to or even outperforms deep learning based MCG methods in the widely used GEOM-QM9 and GEOM-Drugs benchmarks. In particular, our design algorithm is simply the clustering of the RDKIT-generated conformations. We hope our findings can help the community to revise the deep learning methods for MCG. The code of the proposed algorithm could be found at https://gist.github.com/ZhouGengmo/5b565f51adafcd911c0bc115b2ef027c.

研究の動機と目的

  • 深層学習ベースの手法が、分子コンフォーマ生成において、従来のコンフォーマ生成技術を本当に上回っているかどうかを評価すること。
  • GEOM-QM9 や GEOM-Drugs のような現在のベンチマークに内在する制限や潜在的なバイアスを調査すること。
  • 古典的コンピュテーショナルケミストリー手法のみを用いて、単純で効率的かつ効果的な深層学習モデルの代替案を提示すること。
  • 単一のコンフォーマ指標ではなく、応用タスクのパフォーマンスに基づいた分子コンフォーマ生成のベンチマーク手法を提唱すること。
  • 特に、これらのモデルが現実のアプリケーションで実際に導入されていない現状を考えると、深層学習がコンフォーマ生成において本質的に優れていると仮定することの妥当性を再考すること。

提案手法

  • 初期のコンフォーマ生成に、RDKitのETKDGアルゴリズムを用い、一様、幾何学的、エネルギー基準の多様なサンプリング戦略を適用する。
  • 標準のETKDGとは異なり、3つの異なるサンプリング手法を用いることで、より広範かつ多様なコンフォーマの集合を生成する。
  • 教師なしクラスタリングアルゴリズム(例:k-means または類似手法)を用いて、多数のコンフォーマの中から代表的で低エネルギーのものを選別する。
  • GEOM-QM9 および GEOM-Drugs ベンチマークにおける性能評価に、標準的な指標(カバレッジ:COV および マッチング:MAT)を用いる。
  • サンプリングされたコンフォーマ数を変化させたり、個々のサンプリング手法を除外することで、多様性および正確性に与える影響を評価するアブレーションスタディを実施する。
  • 最終的なクラスタリングを施したRDKitパイプラインの性能を、GraphDG、ConfVAE、ConfGF、GeoMol、DGSM、GeoDiff、DMCG といった複数の最先端の深層学習モデルと比較する。

実験結果

リサーチクエスチョン

  • RQ1古典的コンフォーマ生成技術に基づく単純でパラメータフリーなアルゴリズムが、最先端の深層学習モデルを分子コンフォーマ生成において上回ることは可能か?
  • RQ2GEOM-QM9 や GEOM-Drugs のような現在のベンチマークが、従来的手法によって容易に上回れるという事実を踏まえると、それらのベンチマークはどれほどバイアスや操作の余地があると考えられるか?
  • RQ3一様、幾何学的、エネルギー基準の各サンプリング戦略は、生成されたコンフォーマの多様性および正確性にどのように寄与しているか?
  • RQ4分子コンフォーマ生成の現在の評価フレームワークは、分子ドッキングや量子的性質予測といった実世界の応用に十分対応できているか?
  • RQ5将来的なベンチマーク作成は、単一のコンフォーマ指標ではなく、応用タスクのパフォーマンスに基づくべきではないか?

主な発見

  • 提案手法(RDKit + クラスタリング)は、GEOM-QM9 で COV 97.65%、MAT 0.1902 Å を達成し、表1に示されたすべての深層学習モデルを上回った。
  • GEOM-Drugs ベンチマークでは、COV 87.93%、MAT 0.8086 Å を達成し、GeoDiff や DMCG を含むすべての深層学習モデルを上回った。
  • アブレーションスタディの結果、エネルギー基準のサンプリングを除外すると性能が低下した一方、一様サンプリングを除外した場合の影響は小さく、多様性と正確性のトレードオフが顕在された。
  • 幾何学的サンプリングは多様性および正確性の両面で正の寄与を示し、カバレッジとマッチングのバランスを取る上で重要であることが示唆された。
  • 参照コンフォーマ数の10倍($10N_{ref}$)のサンプリングを実施した場合、GEOM-QM9 で COV 96.49%、MAT 0.1941 Å を達成し、サンプリング数の増加が性能向上に寄与することを示した。
  • 本研究は、現在のベンチマークが操作の余地があり、実世界のニーズ、特にバイオアクティブコンフォーマ生成や量子的性質予測といった応用固有のタスクに対して十分に代表的ではない可能性があると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。