[论文解读] Log Barriers for Safe Black-box Optimization with Application to Safe Reinforcement Learning
本文提出LB-SGD,一种安全的黑箱优化方法,通过在对约束条件的对数障碍近似上使用自适应步长的随机梯度下降,确保学习过程中的约束满足。该方法在具有零阶和一阶反馈的高维非凸问题中实现了高效收敛,相较于现有的安全贝叶斯优化方法,样本复杂度和计算复杂度均得到改善。
Optimizing noisy functions online, when evaluating the objective requires experiments on a deployed system, is a crucial task arising in manufacturing, robotics and many others. Often, constraints on safe inputs are unknown ahead of time, and we only obtain noisy information, indicating how close we are to violating the constraints. Yet, safety must be guaranteed at all times, not only for the final output of the algorithm. We introduce a general approach for seeking a stationary point in high dimensional non-linear stochastic optimization problems in which maintaining safety during learning is crucial. Our approach called LB-SGD is based on applying stochastic gradient descent (SGD) with a carefully chosen adaptive step size to a logarithmic barrier approximation of the original problem. We provide a complete convergence analysis of non-convex, convex, and strongly-convex smooth constrained problems, with first-order and zeroth-order feedback. Our approach yields efficient updates and scales better with dimensionality compared to existing approaches. We empirically compare the sample complexity and the computational cost of our method with existing safe learning approaches. Beyond synthetic benchmarks, we demonstrate the effectiveness of our approach on minimizing constraint violation in policy search tasks in safe reinforcement learning (RL).
研究动机与目标
- 开发一种可扩展的安全优化方法,适用于高维随机问题,其中约束条件未知,仅能获得噪声测量值。
- 确保所有优化迭代点始终位于可行集中,防止不安全的系统交互。
- 在高维设置下,相较于现有的安全贝叶斯优化方法,实现更优的样本复杂度和计算复杂度。
- 为安全学习中的零阶和一阶反馈提供统一框架。
- 在安全强化学习和真实世界策略搜索任务中展示方法的有效性。
提出的方法
- LB-SGD使用约束优化问题的对数障碍近似,以在优化过程中保持可行性。
- 该方法应用带有自适应步长规则的随机梯度下降,以最小化对数障碍目标函数。
- 对于零阶反馈,采用基于随机方向和噪声的有限差分法的零阶梯度估计器。
- 对于一阶反馈,直接在SGD更新中使用噪声梯度测量值。
- 通过障碍函数的结构,该算法通过保持迭代点在可行区域内来确保安全性。
- 在光滑性和利普希茨连续性假设下,对非凸、凸和强凸问题进行了收敛性分析。
实验结果
研究问题
- RQ1能否设计一种安全优化方法,在学习过程中始终维持可行性,且无需事先了解约束条件?
- RQ2在高维设置下,LB-SGD的样本复杂度和计算复杂度与安全贝叶斯优化方法相比如何?
- RQ3在仅有噪声函数评估的情况下,LB-SGD能否在非凸问题中收敛至驻点?
- RQ4自适应步长选择对黑箱优化中收敛性和约束违反的影响如何?
- RQ5在安全强化学习策略搜索中,LB-SGD相较于现有安全优化基线方法表现如何?
主要发现
- 在光滑性和利普希茨连续条件下,LB-SGD以高概率收敛至非凸问题的驻点。
- 相较于安全贝叶斯优化方法,该方法在样本复杂度方面表现出更优的扩展性,尤其是在高维情况下。
- 计算成本随数据点数量和维度的增加而高效增长,避免了高斯过程方法的立方级增长。
- 实验结果表明,在安全强化学习的策略搜索任务中,LB-SGD的约束违反显著低于基线方法。
- 理论分析证实,对数障碍近似可确保所有迭代点始终位于可行集中,从而在任何时刻都保证安全性。
- 自适应步长规则有助于在合成和真实世界基准测试中实现更快的收敛速度和更少的约束违反。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。