Skip to main content
QUICK REVIEW

[论文解读] Preference Exploration for Efficient Bayesian Optimization with Multiple Outcomes

Zhiyuan Lin, Raul Astudillo|arXiv (Cornell University)|Mar 21, 2022
Advanced Multi-Objective Optimization Algorithms被引用 7
一句话总结

本文提出贝叶斯优化偏好探索(BOPE),一种人机协同框架,通过实时成对比较进行偏好学习与贝叶斯优化交替进行,以高效优化具有未知效用函数的多目标实验。通过使用基于期望效用的获取函数(EUBO),BOPE 在较少的决策者(DM)交互和实验次数下实现了更高的效用,展现出更优的样本效率和对交互性降低的鲁棒性。

ABSTRACT

We consider Bayesian optimization of expensive-to-evaluate experiments that generate vector-valued outcomes over which a decision-maker (DM) has preferences. These preferences are encoded by a utility function that is not known in closed form but can be estimated by asking the DM to express preferences over pairs of outcome vectors. To address this problem, we develop Bayesian optimization with preference exploration, a novel framework that alternates between interactive real-time preference learning with the DM via pairwise comparisons between outcomes, and Bayesian optimization with a learned compositional model of DM utility and outcomes. Within this framework, we propose preference exploration strategies specifically designed for this task, and demonstrate their performance via extensive simulation studies.

研究动机与目标

  • 解决在决策者(DM)对结果具有未知且复杂偏好时,优化昂贵的多目标实验的挑战。
  • 通过使用结果预测模型进行实时自适应偏好获取,减少耗时的实验和决策者交互次数。
  • 在现有方法如多目标贝叶斯优化和偏好型贝叶斯优化的基础上进行改进,聚焦于帕累托前沿的相关区域,并组合建模偏好。
  • 开发一种支持非单调偏好的框架,实现在无需闭式效用函数的情况下高效交互式优化。
  • 证明交错进行的偏好探索与实验阶段能显著提升优化性能,同时最大限度减少决策者的参与。

提出的方法

  • 该框架在两个阶段之间交替进行:偏好探索(PE),系统向决策者查询结果向量的成对比较;以及实验阶段,评估新设计。
  • 偏好查询通过基于期望效用的获取函数(EUBO)生成,该函数选择能最大程度提升对决策者效用函数信息增益的结果对。
  • 提出了EUBO-ζ和EUBO-~f两种变体,分别在结果空间和结果预测模型上进行优化,以提升查询的相关性和效率。
  • 通过在结果上使用高斯过程建模决策者的未知效用函数,并在每次决策者响应后使用贝叶斯推断更新信念。
  • 该框架支持从真实结果函数f_true的代理模型生成的假设性结果,使查询生成无需等待新实验。
  • 组合模型将f_true的预测与学习到的效用函数g_true的预测相结合,引导优化向高效益设计方向进行。

实验结果

研究问题

  • RQ1在决策者偏好未知的多目标贝叶斯优化中,交错进行的偏好探索与实验阶段是否能提升优化效率?
  • RQ2基于EUBO的偏好查询与PBO-TS和qNParEGO等现有方法相比,在效用增益和样本效率方面表现如何?
  • RQ3在初始实验批次后仅进行一次偏好探索,对优化性能的影响有多大?
  • RQ4在偏好查询中使用代理模型生成结果,是否能减少所需实验次数和决策者交互次数?
  • RQ5该框架是否能有效处理非单调偏好,例如要求结果既不过高也不过低?

主要发现

  • EUBO-ζ和EUBO-~f在所有测试函数中均持续实现最高效用,仅略低于真实效用函数。
  • 所提出的基于EUBO的策略在效用增益方面优于PBO-TS和其他基线方法,同时显著减少了决策者时间投入并减少了实验次数。
  • 即使仅在初始实验批次后进行一次PE阶段,其达到的最大效用水平在统计上与多次PE阶段无显著差异,表明对交互性降低具有鲁棒性。
  • 当PE仅执行一次时,性能未显著下降,表明一次精心选择的PE阶段可能已足够实现高效益优化。
  • 在预测结果空间~f(X)中进行搜索优于在完整结果域Y₀中直接搜索,凸显了在查询生成中利用预测模型的优势。
  • 该框架在处理非单调偏好问题(如要求结果接近目标值而非单调方向)时表现出色。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。