Skip to main content
QUICK REVIEW

[论文解读] Interactive Preference Learning of Utility Functions for Multi-Objective Optimization

Ian Dewancker, Michael McCourt|arXiv (Cornell University)|Dec 14, 2016
Machine Learning and Algorithms参考文献 8被引用 8
一句话总结

本文提出了一种用于多目标优化中标量效用函数的生成模型,采用贝塔分布累积分布函数的乘积来表示利益相关者的偏好。该方法通过二元偏好查询的交互式主动学习,逐步优化效用估计,在包括F1分数和约束阈值目标在内的多种测试案例中,与真实效用函数的相关性高达0.96。

ABSTRACT

Real-world engineering systems are typically compared and contrasted using multiple metrics. For practical machine learning systems, performance tuning is often more nuanced than minimizing a single expected loss objective, and it may be more realistically discussed as a multi-objective optimization problem. We propose a novel generative model for scalar-valued utility functions to capture human preferences in a multi-objective optimization setting. We also outline an interactive active learning system that sequentially refines the understanding of stakeholders ideal utility functions using binary preference queries.

研究动机与目标

  • 为解决多目标机器学习优化中隐式人类偏好的建模挑战,其中利益相关者需在准确率和成本等竞争性度量之间进行权衡。
  • 开发一种灵活的生成式效用函数模型,能够捕捉非线性权衡和约束,例如精确率-召回率平衡或阈值要求。
  • 通过顺序二元偏好查询实现效用函数的交互式主动学习,减少所需交互次数的同时提高准确性。
  • 验证模型在恢复复杂效用结构(包括非线性、约束性和F1分数风格目标)方面的能力,使用模拟人类偏好进行测试。

提出的方法

  • 效用函数建模为单个效用函数的乘积,每个效用函数由参数化形状参数α和β的贝塔分布累积分布函数(CDF)导出。
  • 在log(α)和log(β)上设置对数正态先验,以实现灵活的非负形状学习并量化不确定性。
  • 利益相关者通过比较两个系统配置的二元查询指定偏好,利用贝叶斯推断更新效用参数的后验分布。
  • 主动学习的获取函数——随机、单熵和成对熵——用于选择下一对查询,以最大化关于真实效用的信息增益。
  • 通过使用CDF表示最大化和使用生存函数(1 - CDF)表示最小化,该框架支持对单个度量的最大化和最小化。
  • 该框架支持对个体效用函数的不确定性感知可视化,展示迭代过程中均值和四分位距范围。

实验结果

研究问题

  • RQ1基于贝塔CDF乘积的生成模型能否准确表示涉及权衡和约束的复杂真实世界效用函数?
  • RQ2使用二元偏好查询的交互式主动学习在以最少查询次数恢复未知效用函数方面有多高效?
  • RQ3在不同测试案例中,不同的主动学习获取策略(随机与基于熵)在学习效用函数方面的表现如何比较?
  • RQ4该模型在多大程度上能够捕捉非线性效用结构,如F1和F2分数,或基于阈值的目标?
  • RQ5该模型能否为单个度量提供可靠的不确定性估计,使利益相关者能够审视学习过程?

主要发现

  • 成对熵获取策略在测试效用函数max(5f₁f₂/(4f₁ + f₂))上实现了最高的平均肯德尔等级相关性(0.9120),优于随机和单熵策略。
  • 对于线性效用函数如max(f₁ + 10f₂),使用成对熵搜索的模型实现了0.9615的肯德尔相关性,表明其对线性权衡的强恢复能力。
  • 该模型成功捕捉了阈值约束,如min(f₁)且f₂ > 0.6,表现为f₂的个体效用在0.6附近出现尖锐峰值,而f₁的效用递减,相关性达0.6893。
  • 即使在复杂非线性目标如max(2f₁f₂/(f₁ + f₂))且f₃ > 0.95的约束下,使用成对熵的模型仍实现了0.2648的相关性,表明其对高维约束的鲁棒性。
  • 随机搜索基线表现出意外的优异性能(例如,max(f₁ + 2f₂)为0.8756),表明在无需迭代模型拟合的情况下,低计算开销的方案对较简单情况也足够有效。
  • 个体效用函数的可视化揭示了对单调和非单调行为的准确恢复,包括最小化目标的生存函数。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。