Skip to main content
QUICK REVIEW

[论文解读] Meta Learning Black-Box Population-Based Optimizers

Hugo Siqueira Gomes, Benjamin Léger|arXiv (Cornell University)|Mar 5, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用 5
一句话总结

该论文提出了一种元学习框架——学习优化部分可观察马尔可夫决策过程(LTO-POMDP),可自动为特定问题类别学习基于种群的黑箱优化器。通过将优化建模为部分可观察马尔可夫决策过程,并基于随机算法性能的元损失进行训练,该方法在样本效率和泛化能力方面优于当前最先进算法(如CMA-ES),在多个基准任务和超参数调优场景中,速度提升达两到三倍。

ABSTRACT

The no free lunch theorem states that no model is better suited to every problem. A question that arises from this is how to design methods that propose optimizers tailored to specific problems achieving state-of-the-art performance. This paper addresses this issue by proposing the use of meta-learning to infer population-based black-box optimizers that can automatically adapt to specific classes of problems. We suggest a general modeling of population-based algorithms that result in Learning-to-Optimize POMDP (LTO-POMDP), a meta-learning framework based on a specific partially observable Markov decision process (POMDP). From that framework's formulation, we propose to parameterize the algorithm using deep recurrent neural networks and use a meta-loss function based on stochastic algorithms' performance to train efficient data-driven optimizers over several related optimization tasks. The learned optimizers' performance based on this implementation is assessed on various black-box optimization tasks and hyperparameter tuning of machine learning models. Our results revealed that the meta-loss function encourages a learned algorithm to alter its search behavior so that it can easily fit into a new context. Thus, it allows better generalization and higher sample efficiency than state-of-the-art generic optimization algorithms, such as the Covariance matrix adaptation evolution strategy (CMA-ES).

研究动机与目标

  • 为解决通用黑箱优化器的局限性,这些优化器通常需要大量评估次数,并且在复杂或具有欺骗性的函数上表现有限。
  • 通过实现自动化的、数据驱动的特定问题搜索策略学习,克服手工设计定制优化器所需的高昂成本和专业知识。
  • 通过从相关优化任务中学习归纳偏置,提升黑箱优化中的泛化能力和样本效率。
  • 开发一种无需梯度、基于种群的优化器,仅依赖于解的排序,使其对函数变换保持不变。
  • 在多种优化场景中展示所学优化器的有效性,包括基准函数和机器学习超参数调优。

提出的方法

  • 该方法将基于种群的优化建模为部分可观察马尔可夫决策过程(POMDP),从而从相关优化任务的分布中进行元学习,以获得搜索策略。
  • 使用深度循环神经网络来参数化所学优化器的策略,使其能够保持内部状态并随时间动态调整行为。
  • 设计了一种新颖的元损失函数,基于随机黑箱算法的性能,以鼓励所学优化器在任务间泛化并提升样本效率。
  • 元优化过程使用遗传算法训练策略网络,实现端到端学习,无需对目标函数进行梯度计算。
  • 该框架对函数变换保持不变,仅依赖于每一步中解的相对排序,从而增强鲁棒性和泛化能力。
  • 该方法在多个黑箱优化任务上进行了评估,包括多峰函数和机器学习模型的超参数调优,且在新任务上无需任何超参数调优。

实验结果

研究问题

  • RQ1元学习能否有效应用于学习在相关优化任务间泛化的基于种群的黑箱优化器?
  • RQ2与标准元学习方法相比,基于POMDP的建模是否能实现更好的适应性和泛化能力?
  • RQ3所学优化器是否能在无需任务特定微调的情况下,实现比当前最先进通用算法(如CMA-ES)更高的样本效率和更优性能?
  • RQ4所学优化器在具有不同全局结构特性的多峰函数上,泛化能力如何?
  • RQ5在真实世界中的机器学习模型超参数调优场景中,所学优化器是否能超越基线方法?

主要发现

  • 所学优化器LPBO在Lunacek bi-Rastrigin函数上实现了最高100%的成功率,在Schwefel函数上达到80%,收敛速度优于CMA-ES。
  • 在SVM、FC-Net和XGBoost的超参数调优中,LPBO的速度约为CMA-ES的两倍,尤其在高维空间(如XGBoost的8维)中表现更优。
  • 在具有充分全局结构的多峰函数上,LPBO显著优于CMA-ES和随机搜索,尤其在2维、5维和10维时表现突出。
  • 在全局结构较弱的函数上,LPBO在2维时表现接近CMA-ES,且在较简单的目标上展现出更高的样本效率。
  • 该方法在不同优化任务间无需微调,展示了强大的零样本泛化能力。
  • 元损失函数成功促使所学优化器动态调整其搜索行为,平衡探索与利用,且无需外部机制(如重启或多样性保持)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。