[論文レビュー] ChemoVerse: Manifold traversal of latent spaces for novel molecule discovery
本稿では、ドメイン固有のヒューリスティクスでガイドされたリーマン多様体補間を用いて、分子生成モデルの潜在空間における指向的な探索を可能にするモデルに依存しないフレームワーク、ChemoVerseを提案する。文法変分オートエンコーダーとk-dツリー、Yenのアルゴリズムを組み合わせることで、より優れた薬物感受性とターゲット特異的特性を備えた、新規性と構造的妥当性に優れた効率的な分子生成が可能となり、線形補間よりも優れている。
In order to design a more potent and effective chemical entity, it is essential to identify molecular structures with the desired chemical properties. Recent advances in generative models using neural networks and machine learning are being widely used by many emerging startups and researchers in this domain to design virtual libraries of drug-like compounds. Although these models can help a scientist to produce novel molecular structures rapidly, the challenge still exists in the intelligent exploration of the latent spaces of generative models, thereby reducing the randomness in the generative procedure. In this work we present a manifold traversal with heuristic search to explore the latent chemical space. Different heuristics and scores such as the Tanimoto coefficient, synthetic accessibility, binding activity, and QED drug-likeness can be incorporated to increase the validity and proximity for desired molecular properties of the generated molecules. For evaluating the manifold traversal exploration, we produce the latent chemical space using various generative models such as grammar variational autoencoders (with and without attention) as they deal with the randomized generation and validity of compounds. With this novel traversal method, we are able to find more unseen compounds and more specific regions to mine in the latent space. Finally, these components are brought together in a simple platform allowing users to perform search, visualization and selection of novel generated compounds.
研究の動機と目的
- 分子設計のための高次元的かつスパースな潜在空間におけるランダムかつ非効率的な探索の課題に対処すること。
- 特定の望ましい性質を有する新規で妥当な分子を発見するために、知的で指向的な潜在化学空間の探索を可能にすること。
- フィンガープrint類似度、合成可能性、薬物感受性、結合活性といったドメイン固有のヒューリスティクスを探索プロセスに統合すること。
- 仮想スクリーニングを支援するスケーラブルでモデルに依存しないプラットフォームを構築し、探索、可視化、生成化合物の選択を可能にすること。
提案手法
- SMILESでエンコードされた分子の高品質で妥当な潜在表現を生成するために、文法変分オートエンコーダー(GVAEs)を用い、アテンションを追加した変種も含む。
- 潜在点間のヤコビ行列距離を計算することで、局所的な幾何的歪みをモデル化し、潜在空間内での構造的類似性を保持する。
- ヤコビ行列距離をエッジ重みとして用いて、潜在多様体内での効率的で対数時間オーダーの探索を可能にするk次元木(k-dツリー)を構築する。
- Tanimotoフィンガープリント類似度、合成可能性(SA)スコア、QED薬物感受性、結合活性といった複数のドメインヒューリスティクスをエッジ重みに統合し、ガイドされたパス探索を実現する。
- A*探索を用いたYenのアルゴリズムを適用し、k-dツリー内でソース点とデスティネーション点の間の最短経路を計算し、望ましい分子性質を有する経路を優先する。
- 計算された経路に沿って等距離補間を行い、生成器を用いて潜在ベクトルをデコードすることで、新規で妥当な分子を生成する。
実験結果
リサーチクエスチョン
- RQ1ヒューリスティクスでガイドされたリーマン多様体補間は、ランダムまたは線形サンプリングと比較して、スパースな潜在空間内での新規で妥当な分子の発見を改善するか?
- RQ2Tanimoto類似度、SAスコア、QED、結合活性といった複数の分子性質ヒューリスティクスの統合は、望ましい化学的領域への指向的探索にどの程度効果的か?
- RQ3多様体走査は、構造的妥当性と生成化合物の多様性の観点から、線形補間をどの程度上回るか?
- RQ4このフレームワークは、新規の薬物様化合物に高い可能性を秘めた、これまで未到達の潜在化学空間領域を特定し、探索できるか?
主な発見
- フィンガープリント類似度とYenのアルゴリズムを用いた多様体走査により、糖尿病薬と肺がん薬の潜在領域間で156個の妥当で新規の化合物が生成されたのに対し、100点の線形補間ではたった3個の妥当な化合物にとどまった。
- アテンションを追加した文法VAEは、無効な分子生成率が低く抑えられ、潜在空間サンプリングにおける構造的妥当性の向上を示した。
- ヤコビ行列に基づく距離を用いたk-dツリーは、ブルートフォース法と比較して、実行時間性能を顕著に改善する対数時間オーダーの探索を可能にした。
- ヒューリスティクス重み付きパス探索により、高薬物感受性や結合活性を有する分子が豊富な潜在空間領域への標的的な探索が可能になった。
- ソース点およびデスティネーション点の摂動により、複数の異なる経路が発見され、新規化合物生成の多様性が向上した。
- プラットフォームは、潜在空間内の関心領域を効果的に可視化および境界化し、特定の構造的および機能的特性を有する化合物のマイニングを集中可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。