[论文解读] Sample-efficient Multi-objective Molecular Optimization with GFlowNets
该论文提出 HN-GFN,一种基于超网络的生成流网络(GFlowNet)的样本高效多目标贝叶斯优化框架,能够从近似帕累托前沿生成多样化且高质量的分子候选物。通过条件化偏好向量并采用类似回溯的离策略策略,HN-GFN 在多个分子优化基准上提升了样本效率与性能,其在候选物质量与多样性方面均优于现有方法。
Many crucial scientific problems involve designing novel molecules with desired properties, which can be formulated as a black-box optimization problem over the discrete chemical space. In practice, multiple conflicting objectives and costly evaluations (e.g., wet-lab experiments) make the diversity of candidates paramount. Computational methods have achieved initial success but still struggle with considering diversity in both objective and search space. To fill this gap, we propose a multi-objective Bayesian optimization (MOBO) algorithm leveraging the hypernetwork-based GFlowNets (HN-GFN) as an acquisition function optimizer, with the purpose of sampling a diverse batch of candidate molecular graphs from an approximate Pareto front. Using a single preference-conditioned hypernetwork, HN-GFN learns to explore various trade-offs between objectives. We further propose a hindsight-like off-policy strategy to share high-performing molecules among different preferences in order to speed up learning for HN-GFN. We empirically illustrate that HN-GFN has adequate capacity to generalize over preferences. Moreover, experiments in various real-world MOBO settings demonstrate that our framework predominantly outperforms existing methods in terms of candidate quality and sample efficiency. The code is available at https://github.com/violet-sto/HN-GFN.
研究动机与目标
- 解决在昂贵评估与冲突目标下样本高效、多目标分子优化的挑战。
- 在候选物生成过程中提升目标空间(权衡关系)与搜索空间(分子结构)的多样性。
- 开发一种统一的、偏好条件化的获取函数优化器,无需微调即可泛化至多种目标。
- 通过离策略策略在不同偏好条件下共享高性能分子,加速学习过程。
提出的方法
- 基于超网络的生成流网络(HN-GFN)被训练为在偏好向量条件下生成分子图,从而实现对多项目标之间多样化权衡的灵活探索。
- HN-GFN 使用单一共享的超网络,为不同偏好向量生成策略参数,实现对加权目标分布的统一训练。
- 一种类似回溯的离策略策略将来自一种偏好的高性能分子重用于改进其他偏好的策略,从而加速收敛。
- 该方法与贝叶斯优化循环集成,其中代理模型估计不确定性,而 HN-GFN 优化获取函数以选择信息量丰富且多样化的候选批次。
- 奖励函数通过加权(如加权和或切比雪夫)方式定义,偏好向量从狄利克雷分布中采样,以促进对帕累托前沿的探索。
- 该框架在合成与真实世界分子优化任务中进行了评估,包括 GSK3β、JNK3、QED 和 SA 分数的多属性药物设计。

实验结果
研究问题
- RQ1单一统一的生成流网络模型是否能在无需微调的情况下,有效探索多个冲突分子目标之间的多样化权衡?
- RQ2基于回溯经验回放的离策略学习在多目标分子生成中如何提升样本效率?
- RQ3在帕累托前沿质量与候选物多样性方面,HN-GFN 相较于现有获取函数优化器的性能提升程度如何?
- RQ4在非凸帕累托前沿区域,加权函数的选择(如加权和 vs. 切比雪夫)是否会影响 HN-GFN 的性能?
- RQ5在复杂多目标设置中,HN-GFN 对不同偏好分布与目标难度水平的鲁棒性如何?
主要发现
- 在具有挑战性的 GSK3β+JNK3+QED+SA 基准上,HN-GFN 的超体积(HV)达到 0.416 ± 0.023,显著优于 MARS(0.304 ± 0.075)与 P-MOCO。
- 在 GSK3β+JNK3 设置下,该方法的多样性得分(Div)达到 0.810 ± 0.003,在更复杂的多目标设置下达到 0.744 ± 0.008,表明候选物多样性更优。
- 类似回溯的离策略策略通过加速 HN-GFN 训练,使平均 Top-20 奖励提升,γ=0.2 被选为通用性与特化性之间的最佳平衡。
- 使用 α=(3,4,2,1) 的狄利克雷分布进行偏好采样,性能优于均匀分布 α=(1,1,1,1),尤其在困难优化场景中表现更优。
- 实践中加权和(WS)加权方式优于切比雪夫,表明 HN-GFN 尽管面临切比雪夫函数的非光滑性,仍能有效探索非凸帕累托前沿。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。