QUICK REVIEW
[论文解读] Sequential Preference-Based Optimization
Ian Dewancker, Jakob Bauer|arXiv (Cornell University)|Jan 9, 2018
Advanced Multi-Objective Optimization Algorithms参考文献 11被引用 4
一句话总结
该论文介绍了 PrefOpt,一个用于基于顺序偏好的优化的开源库,通过引入一个具有精度参数 β 的广义 Bradley-Terry 模型,将基于高斯过程的偏好模型扩展以处理用户报告的并列(等价偏好)情况。该方法通过引入并列反馈,提升了人在回路优化中的鲁棒性,尤其在驾驶行为规划等感知度量场景中表现更优,并在使用期望改进获取函数的合成测试函数上,相较于基线方法展现出更优的收敛性能。
ABSTRACT
Many real-world engineering problems rely on human preferences to guide their design and optimization. We present PrefOpt, an open source package to simplify sequential optimization tasks that incorporate human preference feedback. Our approach extends an existing latent variable model for binary preferences to allow for observations of equivalent preference from users.
研究动机与目标
- 为解决在难以定义定量性能指标的复杂工程系统优化问题,尤其是在人类感知起关键作用的情况下。
- 将现有基于偏好的优化模型扩展,以支持用户报告的配置间等价性(并列),从而提升实际应用中的鲁棒性。
- 开发一个开源软件库 PrefOpt,简化基于顺序偏好和人类反馈的优化部署。
- 评估所提出模型和获取函数在仅使用比较反馈的情况下,最小化合成测试函数的有效性。
提出的方法
- 将标准二元偏好模型扩展为支持 '更优'、'更差' 和 '等价' 三种结果的广义 Bradley-Terry 模型,引入并列参数 β。
- 在函数值上使用潜变量高斯过程先验,通过 Sigmoid 变换将无约束的正态变量转换为长度尺度,以保证其正值。
- 采用变分推断并结合均场近似,联合推断潜变量函数值和超参数,利用 Edward 实现可扩展的推断。
- 采用期望改进(EI)获取函数选择下一个查询点进行比较,实现探索与利用的平衡。
- 采用顺序优化循环,用户每次比较两个配置,模型在每次反馈后更新对偏好格局的信念。
- 支持批量查询策略,并与用户友好的 API 集成,适用于现实场景中的交互式优化。
实验结果
研究问题
- RQ1支持用户报告并列(等价偏好)的偏好模型是否能提升人在回路优化的鲁棒性和收敛性?
- RQ2与仅支持二元偏好的模型相比,并列反馈的引入对优化性能有何影响?
- RQ3在支持并列反馈的偏好优化中,期望改进获取函数是否优于纯探索和随机搜索?
- RQ4该方法在不同等价容忍度水平下的合成测试函数中泛化能力如何?
主要发现
- 在所有测试的合成测试函数中,期望改进获取函数均优于纯探索和随机搜索,表现出更快收敛至最优配置。
- 该方法在等价性的低容忍度(ε=0.001)和高容忍度(ε=0.1)阈值下均表现出稳健性能,表明对用户不一致性具有鲁棒性。
- 通过广义 Bradley-Terry 模型引入并列反馈,改善了模型校准性,降低了偏好判断中的过度自信,尤其在用户难以区分选项时效果显著。
- PrefOpt 库成功实现了高效、交互式的优化,用户负担极小,仅需进行成对比较和等价性反馈。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。