Skip to main content
QUICK REVIEW

[论文解读] Multi-Attribute Bayesian Optimization With Interactive Preference Learning

Raul Astudillo, Peter I. Frazier|arXiv (Cornell University)|Nov 13, 2019
Data Stream Mining Techniques被引用 10
一句话总结

本文提出了一种多属性贝叶斯优化框架,结合交互式偏好学习以处理决策者效用函数中的不确定性。通过使用新型采集函数——效用不确定性下的期望改进(EI-UU)与效用不确定性下的汤普森采样(TS-UU),该方法选择在一系列合理效用函数下均表现稳健的设计,最终提供一组高质量的选项供最终选择,其在偏好鲁棒性和查询效率方面优于基于点估计的方法。

ABSTRACT

We consider black-box global optimization of time-consuming-to-evaluate functions on behalf of a decision-maker (DM) whose preferences must be learned. Each feasible design is associated with a time-consuming-to-evaluate vector of attributes and each vector of attributes is assigned a utility by the DM's utility function, which may be learned approximately using preferences expressed over pairs of attribute vectors. Past work has used a point estimate of this utility function as if it were error-free within single-objective optimization. However, utility estimation errors may yield a poor suggested design. Furthermore, this approach produces a single suggested "best" design, whereas DMs often prefer to choose from a menu. We propose a novel multi-attribute Bayesian optimization with preference learning approach. Our approach acknowledges the uncertainty in preference estimation and implicitly chooses designs to evaluate that are good not just for a single estimated utility function but a range of likely ones. The outcome of our approach is a menu of designs and evaluated attributes from which the DM makes a final selection. We demonstrate the value and flexibility of our approach in a variety of experiments.

研究动机与目标

  • 解决单目标贝叶斯优化方法在假设决策者偏好完全已知时的局限性。
  • 克服基于点估计的偏好学习的脆弱性,后者可能因估计误差导致次优设计。
  • 开发一种通过成对判断主动学习偏好的方法,同时在效用估计中保持不确定性。
  • 生成一组多样化且高质量的设计,以适应决策者不确定的偏好,而非仅推荐单一“最优”设计。
  • 通过聚焦于属性空间中最受青睐的区域,减少昂贵函数评估的次数。

提出的方法

  • 使用贝叶斯后验分布对决策者的效用函数进行建模,通过成对偏好反馈更新效用参数。
  • 使用多输出高斯过程对黑箱属性函数 f(x) ∈ ℝᵏ 进行建模,捕捉属性预测中的不确定性。
  • 提出两种新型采集函数:EI-UU 与 TS-UU,它们在设计选择过程中显式考虑效用函数的不确定性。
  • 采用基于模拟的梯度估计器计算 EI-UU 的无偏梯度,支持随机优化。
  • 在优化过程中支持增量式偏好更新,使模型能随着新判断的接收不断细化效用信念。
  • 输出最终的评估设计菜单,供决策者选择,体现对不确定性的感知探索与利用。

实验结果

研究问题

  • RQ1当决策者的效用函数不确定且必须通过交互方式学习时,如何将贝叶斯优化扩展至多属性目标?
  • RQ2是否能够证明,考虑效用不确定性的采集函数在鲁棒性与最终效用方面优于标准的基于点估计的采集函数?
  • RQ3与多目标或单目标方法相比,偏好学习在多大程度上能减少昂贵函数评估的次数?
  • RQ4当真实效用函数未知且仅通过成对比较部分观测时,该方法如何在探索与利用之间取得平衡?
  • RQ5该方法能否生成一组多样化但高质量的设计,使其比单一设计推荐更能反映决策者的真实偏好?

主要发现

  • 所提出的 EI-UU 与 TS-UU 采集函数在应对效用估计误差方面显著提升了鲁棒性,优于标准的点估计方法。
  • 该方法通过聚焦于属性空间中最受青睐的区域,减少了所需函数评估的次数,其优化方向由学习到的偏好所引导。
  • 在合成实验中,该方法通过从设计菜单中选择,实现了接近最优的效用,优于在偏好不确定性下进行单设计优化的方法。
  • 理论分析表明,EI-UU 在凸且非递减的效用函数下继承了经典期望改进的优良探索-利用平衡特性。
  • 针对 EI-UU 的基于模拟的梯度估计器即使在函数复杂的情况下也能实现有效优化,使该方法在计算上可行。
  • 该方法成功将经典贝叶斯优化推广至结合交互式偏好学习的多属性场景,为帕累托前沿估计提供了一种实用的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。