Skip to main content
QUICK REVIEW

[論文レビュー] Persistent spectral based machine learning (PerSpect ML) for drug design

Zhenyu Meng, Kelin Xia|arXiv (Cornell University)|Feb 3, 2020
Topological and Geometric Data Analysis参考文献 49被引用数 11
ひとこと要約

本稿では、タンパク質-リガンド結合親和性予測のためのマルチスケール位相的特徴を生成するために、恒常的ホモロジーとスペクトルグラフ理論、単体的複体理論、ハイパーグラフ理論を統合した新規フレームワーク、Persistent Spectral Machine Learning (PerSpect ML) を提案する。距離または相互作用強度のしきい値を用いたフィルトレーションを適用することで、ラプラシアン固有値から恒常的スペクトル変数(恒常的多重度、平均、エネルギーなど)を導出し、PDBbind-2007、PDBbind-2013、PDBbind-2016で最先端の性能を達成した。ピアソン積率相関係数(PCC)は最大0.840、平均二乗誤差(RMSE)は1.724 kcal/molまで低下した。

ABSTRACT

In this paper, we propose persistent spectral based machine learning (PerSpect ML) models for drug design. Persistent spectral models, including persistent spectral graph, persistent spectral simplicial complex and persistent spectral hypergraph, are proposed based on spectral graph theory, spectral simplicial complex theory and spectral hypergraph theory, respectively. Different from all previous spectral models, a filtration process, as proposed in persistent homology, is introduced to generate multiscale spectral models. More specifically, from the filtration process, a series of nested topological representations, i,e., graphs, simplicial complexes, and hypergraphs, can be systematically generated and their spectral information can be obtained. Persistent spectral variables are defined as the function of spectral variables over the filtration value. Mathematically, persistent multiplicity (of zero eigenvalues) is exactly the persistent Betti number (or Betti curve). We consider 11 persistent spectral variables and use them as the feature for machine learning models in protein-ligand binding affinity prediction. We systematically test our models on three most commonly-used databases, including PDBbind-2007, PDBbind-2013 and PDBbind-2016. Our results, for all these databases, are better than all existing models, as far as we know. This demonstrates the great power of our PerSpect ML in molecular data analysis and drug design.

研究の動機と目的

  • バイオ分子のマルチスケール位相的およびスペクトル的特徴を捉える新しい機械学習フレームワークの開発。
  • 従来のスペクトルモデルの限界を克服するため、恒常的スペクトル表現を生成するフィルトレーションプロセスの導入。
  • 恒常的スペクトル理論から導出される位相的、幾何的、代数的不変量を用いて、タンパク質-リガンド結合親和性予測における特徴表現を向上。
  • 標準ベンチマークデータベース(PDBbind-2007、-2013、-2016)上で提案されたPerSpect MLモデルを体系的に評価し、既存の最先端モデルと比較。
  • 恒常的スペクトル変数が、化学情報学およびバイオインフォマティクス応用における予測性能を顕著に向上させることの実証。

提案手法

  • グラフ、単体的複体、ハイパーグラフのスペクトル理論に基づき、恒常的スペクトルグラフ、恒常的スペクトル単体的複体、恒常的スペクトルハイパーグラフの3つの恒常的スペクトルモデルを提案。
  • 恒常的ホモロジーにインspiredされたフィルトレーションプロセスを導入し、フィルトレーション値を段階的に増加させることで、位相的表現(グラフ、単体的複体、ハイパーグラフ)を体系的に生成。
  • 恒常的多重度(ベッチ曲線に関連)、恒常的平均、標準偏差、最大値、最小値、ラプラシアングラフエネルギー、一般化平均エネルギー、2次スペクトルモーメント、準ウィーナー指数、スパニングツリー数を含む、合計11種類の恒常的スペクトル変数を特徴量として定義。
  • 各システムに対して、距離(0.00–25.00 Å、0.10 Å刻み)と相互作用強度(0.00–1.00、0.01刻み)をフィルトレーションパラメータとして用い、それぞれ250および100個のラプラシアン行列を生成。
  • 高次元特徴ベクトルの処理と過学習の防止を目的として、40,000の推定器、最大深さ6、学習率0.001、70%のサブサンプリングを用いた勾配ブーストツリー(GBT)モデルを適用。
  • ES-IDM(原子間距離に基づく)とES-IEM(相互作用エネルギーに基づく)の2種類のモデルの特徴を統合し、それぞれ36および50の原子種組み合わせを想定。これにより、1分子あたり99,000および55,000の特徴量が得られた。

実験結果

リサーチクエスチョン

  • RQ1恒常的スペクトル理論をグラフ、単体的複体、ハイパーグラフに拡張することで、バイオ分子のマルチスケール位相的表現を構築できるか?
  • RQ2フィルトレーションプロセスを経てラプラシアン行列の固有値から導出される恒常的スペクトル変数は、ドラッグデザインに生物学的に関連する構造的・エネルギー的特徴を捉えられるか?
  • RQ3既存の最先端モデルと比較して、PerSpect MLの特徴量はタンパク質-リガンド結合親和性予測の精度を向上させられるか?
  • RQ4距離と相互作用強度の異なるフィルトレーションパラメータは、結合親和性予測におけるPerSpect MLの性能にどのように影響を与えるか?
  • RQ5複数の恒常的スペクトル特徴(多重度、エネルギー、モーメントなど)を統合することは、ドラッグディスカバリの機械学習モデルにおいて個々の特徴量よりも効果的か?

主な発見

  • PerSpect MLは、PDBbind-2016データセットで最高のピアソン積率相関係数(PCC)0.840を達成し、これまでに報告されたすべてのモデルを上回った。
  • PDBbind-2016では、平均二乗誤差(RMSE)が1.724 kcal/molにまで低下し、テスト済みのすべての既存モデルの中で最小であった。
  • PDBbind-2007では、PCCが0.829、RMSEが1.868 kcal/molを記録し、両方とも従来の最先端結果を上回った。
  • ES-IDMとES-IEMの組み合わせモデルは、すべての3つのデータセットで個々のモデルを上回り、PDBbind-2007ではPCC 0.836、PDBbind-2016ではPCC 0.840を達成した。
  • 10個の独立した回帰モデルを用いた勾配ブーストツリーと中央値レポートの組み合わせにより、性能指標の頑健性が向上し、ばらつきが低減された。
  • 恒常的多重度が数学的に恒常的ベッチ数に正確に対応することが示され、フレームワークの位相的整合性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。