[论文解读] Improve Single-Point Zeroth-Order Optimization Using High-Pass and Low-Pass Filters
本文提出 HLF-SZO,一种新型的单点零阶优化方法,通过整合高通和低通滤波器以降低方差并加速收敛。通过将高通滤波器解释为残差反馈,低通滤波器解释为动量,HLF-SZO 在凸与非凸设置下均实现了改进的迭代复杂度 𝒪(d^{3/2}/ε^{3/2}),在数值实验中优于原始 SZO 和残差反馈 SZO 方法。
Single-point zeroth-order optimization (SZO) is useful in solving online black-box optimization and control problems in time-varying environments, as it queries the function value only once at each time step. However, the vanilla SZO method is known to suffer from a large estimation variance and slow convergence, which seriously limits its practical application. In this work, we borrow the idea of high-pass and low-pass filters from extremum seeking control (continuous-time version of SZO) and develop a novel SZO method called HLF-SZO by integrating these filters. It turns out that the high-pass filter coincides with the residual feedback method, and the low-pass filter can be interpreted as the momentum method. As a result, the proposed HLF-SZO achieves a much smaller variance and much faster convergence than the vanilla SZO method and empirically outperforms the residual-feedback SZO method, which is verified via extensive numerical experiments.
研究动机与目标
- 解决原始单点零阶优化(SZO)在在线与时变环境中估计方差高、收敛慢的问题。
- 通过借鉴极值寻求控制中的滤波技术,弥合零阶优化与极值寻求控制之间的差距。
- 开发一种新型 SZO 方法,实现比现有方法更快的收敛速度与更低的方差。
- 在标准光滑性与利普希茨条件下,理论建立所提方法的改进迭代复杂度。
- 通过实验验证该方法在具有挑战性的优化任务中优于原始 SZO 和残差反馈 SZO 的优越性。
提出的方法
- 该方法将高通滤波器集成到 SZO 框架中,其数学等价于近期研究中使用的残差反馈方案。
- 引入低通滤波器以模拟动量(Heavy-ball)方法,提升收敛速度。
- 结合的滤波机制可降低梯度估计方差,并在噪声或非平稳环境中提升稳定性。
- 该算法每轮迭代仅使用一次函数评估,保持了 SZO 的在线与自适应特性。
- 滤波过程以前向时间离散化形式实现,参数经调优以平衡噪声抑制与响应速度。
- 该方法设计用于兼容在线与黑箱优化,尤其适用于控制与强化学习场景。
实验结果
研究问题
- RQ1能否有效将极值寻求控制中的高通与低通滤波技术适配到单点零阶优化中?
- RQ2与原始方法及残差反馈方法相比,集成滤波机制是否能降低 SZO 中的方差并加速收敛?
- RQ3在标准光滑性与利普希茨条件下,所提 HLF-SZO 方法的理论迭代复杂度是多少?
- RQ4在非平稳或噪声优化问题(如在线 LQR 控制)中,HLF-SZO 的实际表现如何?
- RQ5基于滤波的方法是否能在保持 SZO 单次评估优势的同时,实现与双点 ZO 方法相当的性能?
主要发现
- 所提 HLF-SZO 方法在凸与非凸问题中均实现了 𝒪(d^{3/2}/ε^{3/2}) 的迭代复杂度,优于原始 SZO 的 𝒪(d²/ε³) 复杂度。
- HLF-SZO 中的高通滤波器组件等价于残差反馈机制,显著降低了梯度估计方差。
- 低通滤波器组件对应于动量方法,有助于实现更快的收敛速率。
- 在 LQR 问题的数值实验中,HLF-SZO 的收敛速度优于残差反馈 SZO,且性能接近双点 ZO 方法。
- 在不同系统噪声水平(δ = 0, 0.005, 0.01)下,HLF-SZO 在所有情况下均保持比残差反馈 SZO 更快的收敛速度与更高的精度。
- 该方法在收敛速度与方差降低方面均显著优于原始 SZO,展现出在在线与噪声环境下的实际优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。