Skip to main content
QUICK REVIEW

[論文レビュー] A COLD Approach to Generating Optimal Samples

Omar Mahmood, José Miguel Hernández-Lobato|arXiv (Cornell University)|May 23, 2019
Computational Drug Discovery Methods参考文献 11被引用数 6
ひとこと要約

本稿では、学習データの潜在変数のガウス・ミクスチャ・モデル(GMM)を用いて潜在空間内の高密度領域を特定し、勾配ベース最適化によって高得点で多様かつ新規の離散的サンプルを生成する、制約付きグローバル最適化手法COLDを提案する。MNISTおよびChEMBLにおいて、COLDは薬物様性スコアが学習データの最大値と同等またはそれを上回る、最適で多様かつ化学的に妥当な分子を生成した。

ABSTRACT

Optimising discrete data for a desired characteristic using gradient-based methods involves projecting the data into a continuous latent space and carrying out optimisation in this space. Carrying out global optimisation is difficult as optimisers are likely to follow gradients into regions of the latent space that the model has not been exposed to during training; samples generated from these regions are likely to be too dissimilar to the training data to be useful. We propose Constrained Optimisation with Latent Distributions (COLD), a constrained global optimisation procedure to find samples with high values of a desired property that are similar to yet distinct from the training data. We find that on MNIST, our procedure yields optima for each of three different objectives, and that enforcing tighter constraints improves the quality and increases the diversity of the generated images. On the ChEMBL molecular dataset, our method generates a diverse set of new molecules with drug-likeness scores similar to those of the highest-scoring molecules in the training data. We also demonstrate a computationally efficient way to approximate the constraint when evaluating it exactly is computationally expensive.

研究の動機と目的

  • 離散データにおける勾配ベース最適化の限界、特に未学習の潜在空間領域での一般化の悪さにより、通常は学習済みサンプルの改善にとどまることを解決すること。
  • 潜在空間の良好に学習された領域に最適化を制約することで、学習データとは異なる新規で高得点のサンプルを生成するグローバル最適化を可能にすること。
  • 特に高次元データにおいて、潜在空間の密度を近似する計算効率の良い手法を考案すること。
  • 潜在空間における最小密度閾値を課すことにより、生成されたサンプルが高得点であり、かつ化学的・構造的に妥当であることを保証すること。
  • 高密度の潜在空間領域における制約付き最適化が、MNISTやChEMBLを含む複数のデータセットで多様で高品質なサンプルを生成できることを示すこと。

提案手法

  • VAEと予測ヘッドを併せて学習する予測変分オートエンコーダー(PVAE)を用い、データを連続的潜在空間にマップし、目的の特性を予測する。
  • すべての学習データポイントの符号化された平均と分散からなるガウス・ミクスチャ・モデル(GMM)を構築し、良好に学習された潜在空間領域の分布を表現する。
  • 密度閾値ηを用いて候補となる潜在空間ポイントをフィルタリングし、GMMの高密度領域にあるもののみを保持することで、生成されたサンプルが学習データに類似していることを保証する。
  • 予測された目的スコアに基づき上位t個の候補ポイントを選択し、これらの点から局所的な勾配ベース最適化を実行して高得点のサンプルを同定する。
  • 特に高次元空間において計算効率を高めるために、HNSWを用いたk近傍法(k-NN)を用いてGMM密度を近似する。
  • 最終的に最適化された潜在空間ポイントをVAEデコーダーで復元し、真の目的特性を評価することでグローバル最適解を同定する。

実験結果

リサーチクエスチョン

  • RQ1VAEの潜在空間における制約付き最適化は、学習データに類似しながらも新規で高得点の離散的サンプルを生成できるか?
  • RQ2潜在空間にGMMベースの密度制約を課すことで、制約なしまたは局所最適化と比較して、生成サンプルの品質と多様性にどのような影響を与えるか?
  • RQ3密度閾値ηを変化させた場合、生成サンプルのスコア、多様性、妥当性という観点から最適化結果にどのような影響が生じるか?
  • RQ4GMM密度のk-NN近似は、高次元潜在空間におけるスケーラブルで効率的なグローバル最適化を可能にするか?
  • RQ5COLDは、学習データ内で最高のものを上回る薬物様性スコアを達成しながら、構造的に新規な分子をどの程度生成できるか?

主な発見

  • MNISTでは、COLDは3つの異なる目的に対して最適な画像を生成でき、制約を厳しくすることでサンプルの品質と多様性が向上した。
  • ChEMBLデータセットでは、COLDはQEDスコアが学習データで最高の0.9483に達する多様な新規分子を生成し、生成された分子のいずれとも学習データに存在しなかった。
  • 密度閾値ηを-1000から-5000に低下させても、最高得点の分子は変化しなかったため、緩い制約下でも単一のグローバル最適解に収束していることが示された。
  • ηが低下するにつれて、正常に復元可能な分子の割合は一般的に減少したが、高密度領域(b=1)からサンプリングした際には例外的だった。これは、低密度領域の点は復元にあまり信頼性がないことを示唆している。
  • 本手法は頑健であった:同じ制約で複数回の最適化を実行しても、すべて同じ最適解に収束した。これは、潜在空間における予測器の表面が鋭い局所最適解を持つ可能性があることを示している。
  • HNSWを用いたk-NN近似により、GMM密度の評価が効率的に行えるようになり、大規模な学習データセットと高次元潜在空間へのスケーラビリティが実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。