[论文解读] From Complexity to Simplicity: Adaptive ES-Active Subspaces for Blackbox Optimization
本文提出ASEBO,一种新颖的自适应进化策略,用于黑箱优化,通过主动子空间和压缩感知动态学习最优感知方向。通过持续适应高维函数的内在维度和几何结构,ASEBO在无需外部监督的情况下,相较于最先进方法实现了更高的样本效率,在强化学习和基准优化任务中显著减少了查询次数。
We present a new algorithm ASEBO for optimizing high-dimensional blackbox functions. ASEBO adapts to the geometry of the function and learns optimal sets of sensing directions, which are used to probe it, on-the-fly. It addresses the exploration-exploitation trade-off of blackbox optimization with expensive blackbox queries by continuously learning the bias of the lower-dimensional model used to approximate gradients of smoothings of the function via compressed sensing and contextual bandits methods. To obtain this model, it leverages techniques from the emerging theory of active subspaces in the novel ES blackbox optimization context. As a result, ASEBO learns the dynamically changing intrinsic dimensionality of the gradient space and adapts to the hardness of different stages of the optimization without external supervision. Consequently, it leads to more sample-efficient blackbox optimization than state-of-the-art algorithms. We provide theoretical results and test ASEBO advantages over other methods empirically by evaluating it on the set of reinforcement learning policy optimization tasks as well as functions from the recently open-sourced Nevergrad library.
研究动机与目标
- 解决在函数评估成本高昂的高维设置下,黑箱优化的高样本复杂度问题。
- 通过实现对函数几何结构的动态适应,克服进化策略中固定方向或固定维度方法的局限性。
- 通过压缩感知与上下文Bandits在线学习梯度近似偏差,改善无导数优化中的探索-利用平衡。
- 在多种黑箱函数(包括非MDP和不可微任务)上实现鲁棒且样本高效的优化。
- 通过在线学习最优感知子空间,减少对人工超参数调优的依赖。
提出的方法
- ASEBO利用主动子空间理论识别函数变化最显著的低维子空间,实现高效的梯度近似。
- 它使用压缩感知,从沿自适应感知方向的随机投影中估计平滑黑箱函数的梯度。
- 该算法采用上下文Bandits动态选择感知方向,基于历史表现平衡探索与利用。
- 它持续更新梯度空间的低维模型,在优化过程中学习函数几何的内在维度。
- ASEBO分别维护对主动子空间(梯度较强区域)及其正交补空间的估计,并利用浓度不等式确保鲁棒性。
- 该方法根据观测到的信号强度自适应调整感知方向数量,避免使用固定或预设的子空间。
实验结果
研究问题
- RQ1主动子空间能否有效集成到进化策略中,以提升高维黑箱优化中的样本效率?
- RQ2在缺乏先验知识的情况下,如何在优化过程中自适应地学习黑箱函数的内在维度?
- RQ3压缩感知与上下文Bandits在无导数优化中能在多大程度上提升梯度近似效果?
- RQ4ASEBO在多样化优化任务中是否在查询效率方面优于固定超参数引导的ES方法及CMA-ES变体?
- RQ5ASEBO能否在不依赖结构假设的前提下,泛化到非MDP和不可微的黑箱函数?
主要发现
- 在强化学习策略优化任务中,ASEBO的查询次数显著低于最先进方法,展现出卓越的样本效率。
- 该算法能够动态学习梯度空间的内在维度,适应优化各阶段函数复杂度的变化。
- 在Nevergrad基准库上的实证结果表明,ASEBO在CMA-ES、ARS及其他引导式ES变体方法上均表现出一致的性能提升。
- ASEBO通过在线学习最优感知方向,减少了对人工超参数调优的依赖,其性能优于采用固定缓冲长度或固定子空间的方法。
- 理论分析证实,ASEBO的梯度近似误差以高概率有界,支持其鲁棒性与收敛性。
- 压缩感知与上下文Bandits有效实现了探索-利用的权衡,尤其在高维与非光滑场景中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。