Skip to main content
QUICK REVIEW

[論文レビュー] Sample-efficient Multi-objective Molecular Optimization with GFlowNets

Yiheng Zhu, Jialu Wu|arXiv (Cornell University)|Feb 8, 2023
Computational Drug Discovery Methods被引用数 6
ひとこと要約

本稿では、近似的なパレートフロントから多様で高品質な分子候補を生成するために、ハイパーネットワークに基づくGFlowNetを用いた、サンプル効率の高い多目的ベイズ最適化フレームワーク、HN-GFNを提案する。好みのベクトルに条件付け、後悔に似たオフポリシー戦略を採用することで、複数の分子最適化ベンチマークにおいて、サンプル効率と性能が向上し、既存の手法を上回る結果を示した。

ABSTRACT

Many crucial scientific problems involve designing novel molecules with desired properties, which can be formulated as a black-box optimization problem over the discrete chemical space. In practice, multiple conflicting objectives and costly evaluations (e.g., wet-lab experiments) make the diversity of candidates paramount. Computational methods have achieved initial success but still struggle with considering diversity in both objective and search space. To fill this gap, we propose a multi-objective Bayesian optimization (MOBO) algorithm leveraging the hypernetwork-based GFlowNets (HN-GFN) as an acquisition function optimizer, with the purpose of sampling a diverse batch of candidate molecular graphs from an approximate Pareto front. Using a single preference-conditioned hypernetwork, HN-GFN learns to explore various trade-offs between objectives. We further propose a hindsight-like off-policy strategy to share high-performing molecules among different preferences in order to speed up learning for HN-GFN. We empirically illustrate that HN-GFN has adequate capacity to generalize over preferences. Moreover, experiments in various real-world MOBO settings demonstrate that our framework predominantly outperforms existing methods in terms of candidate quality and sample efficiency. The code is available at https://github.com/violet-sto/HN-GFN.

研究の動機と目的

  • 高価な評価が伴う状況下で、複数の対立する目的を満たすサンプル効率の高い多目的分子最適化の課題に取り組む。
  • 候補生成プロセスにおいて、目的空間(トレードオフ)および探索空間(分子構造)における多様性を向上させる。
  • 再訓練を必要とせず、複数の目的に一般化可能な統合的で好みに依存する獲得関数最適化手法を開発する。
  • オフポリシー戦略により、異なる好みの条件間で高パフォーマンスの分子を共有することで、学習を加速する。

提案手法

  • 好みのベクトルに条件付けられたハイパーネットベースのGFlowNet(HN-GFN)を訓練し、複数の目的間の多様なトレードオフを柔軟に探索可能にする。
  • HN-GFNは、スカラー化された目的の分布全体にわたって統合的に学習可能となるように、1つの共有ハイパーネットによって異なる好みのベクトルのためのポリシー・パラメータを生成する。
  • 後悔に似たオフポリシー戦略により、ある好みの条件で得られた高パフォーマンスの分子を他の好みの条件のポリシー改善に再利用し、収束を加速する。
  • サーヴェイモデルが不確実性を推定するベイズ最適化ループに統合され、HN-GFNは獲得関数を最適化して情報量が多く多様な候補バッチを選択する。
  • 報酬関数はスカラー化(例:重み付き和またはチコビェフ)により定義され、パレートフロントの探索を促進するため、好みのベクトルはディリクレ分布からサンプリングされる。
  • 本フレームワークは、GSK3β、JNK3、QED、SAスコアを含む合成的および実世界の分子最適化タスクで評価されている。
Figure 1: MOBO loop for molecular optimization using a surrogate model $\mathcal{M}$ for uncertainty estimation and HN-GFN for acquisition function optimization. In each round, the policy $\pi_{\theta}$ is trained with reward function $R_{\lambda}$ , where $\lambda$ is sampled from $\operatorname{Di
Figure 1: MOBO loop for molecular optimization using a surrogate model $\mathcal{M}$ for uncertainty estimation and HN-GFN for acquisition function optimization. In each round, the policy $\pi_{\theta}$ is trained with reward function $R_{\lambda}$ , where $\lambda$ is sampled from $\operatorname{Di

実験結果

リサーチクエスチョン

  • RQ1再訓練を伴わず、1つの統合的GFlowNetモデルが、複数の対立する分子的目的間の多様なトレードオフを効果的に探索できるか?
  • RQ2後悔に似た経験リプレイに基づくオフポリシー学習は、多目的分子生成におけるサンプル効率をどのように向上させるか?
  • RQ3HN-GFNは、パレートフロントの質および候補の多様性という観点から、既存の獲得関数最適化手法をどの程度上回るか?
  • RQ4スカラー化関数の選択(例:重み付き和対チコビェフ)が、非凸なパレートフロント領域におけるHN-GFNの性能に与える影響は何か?
  • RQ5複雑な多目的設定において、好みの分布や目的の難易度の変化に対して、HN-GFNはどの程度頑健か?

主な発見

  • HN-GFNは、挑戦的なGSK3β+JNK3+QED+SAベンチマークでハイパーボリューム(HV)0.416 ± 0.023を達成し、MARS(0.304 ± 0.075)およびP-MOCOを著しく上回った。
  • GSK3β+JNK3設定では多様性スコア(Div)が0.810 ± 0.003、より複雑な多目的設定では0.744 ± 0.008を達成し、優れた候補の多様性を示した。
  • 後悔に似たオフポリシー戦略により、HN-GFNの学習が加速され、平均Top-20報酬が向上した。γ=0.2が一般化と特化のバランスを最適にしたと判明した。
  • 好みのサンプリングにα=(3,4,2,1)のディリクレ分布を用いることで、特に困難な最適化状況において、均一分布α=(1,1,1,1)よりも優れた性能が得られた。
  • 実践的には重み付き和(WS)スカラー化がチコビェフを上回った。これは、HN-GFNが非滑らかさを有するチコビェフでさえも、非凸なパレートフロントを効果的に探索できることを示唆している。
Figure 2: Left : The distribution of Top-100 $\text{JNK}3$ scores. Right : The progression of the average Top-20 rewards over the course of training of the HN-GFN in optimizing $\text{GSK3}\beta$ and $\text{JNK}3$ .
Figure 2: Left : The distribution of Top-100 $\text{JNK}3$ scores. Right : The progression of the average Top-20 rewards over the course of training of the HN-GFN in optimizing $\text{GSK3}\beta$ and $\text{JNK}3$ .

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。