Skip to main content
QUICK REVIEW

[论文解读] Bandit-Based Random Mutation Hill-Climbing

Jialin Liu, Diego Pérez-Liébana|arXiv (Cornell University)|Jun 20, 2016
Advanced Bandit Algorithms Research参考文献 21被引用 3
一句话总结

本文提出一种基于多臂赌博机的随机突变爬山法(RMHC)算法,以多臂赌博机选择单元替代随机邻居选择,实现探索与利用的平衡。该算法在噪声环境下的OneMax和Royal Road问题中显著优于标准RMHC,将适应度评估次数减少高达十倍,尤其在重采样次数为2时表现最佳,且适应度评估次数与问题规模呈线性关系。

ABSTRACT

The Random Mutation Hill-Climbing algorithm is a direct search technique mostly used in discrete domains. It repeats the process of randomly selecting a neighbour of a best-so-far solution and accepts the neighbour if it is better than or equal to it. In this work, we propose to use a novel method to select the neighbour solution using a set of independent multi- armed bandit-style selection units which results in a bandit-based Random Mutation Hill-Climbing algorithm. The new algorithm significantly outperforms Random Mutation Hill-Climbing in both OneMax (in noise-free and noisy cases) and Royal Road problems (in the noise-free case). The algorithm shows particular promise for discrete optimisation problems where each fitness evaluation is expensive.

研究动机与目标

  • 解决标准RMHC在适应度评估代价高昂的噪声复杂离散优化问题中效率低下的问题。
  • 通过整合多臂赌博机选择机制,改进爬山法中的探索-利用权衡。
  • 开发一种可扩展且鲁棒的优化方法,适用于具有噪声或不确定适应度评估的实际应用场景。
  • 在标准基准问题(包括OneMax和Royal Road函数)上评估基于赌博机的RMHC性能。
  • 证明基于赌博机的选择机制相比随机邻居选择,能实现更快收敛并降低评估开销。

提出的方法

  • 将二进制字符串中的每个基因建模为一个双臂赌博机,其中两臂分别对应将该位翻转为0或1。
  • 使用置信上界(UCB)算法选择下一个邻居,通过紧急程度项平衡探索与利用。
  • 存储并按基因更新适应度评估结果,通过重采样以减轻评估中的噪声影响。
  • 维护迄今为止最优的解,基于每次突变带来的适应度增益更新赌博机单元。
  • 通过UCB的探索项动态优先选择有希望的基因值,同时探索未充分采样的选项。
  • 将该方法应用于不同问题规模和块大小的OneMax与Royal Road问题。

实验结果

研究问题

  • RQ1基于赌博机的选择机制是否能提升随机突变爬山法在噪声复杂离散优化问题中的性能?
  • RQ2在OneMax和Royal Road函数上,基于赌博机的RMHC相较于标准RMHC在适应度评估效率方面表现如何?
  • RQ3在噪声环境中,基于赌博机的RMHC的最优重采样次数是多少?其对收敛性有何影响?
  • RQ4基于赌博机的方法是否与问题维度呈线性可扩展?其在信用分配中的延迟适应度奖励处理能力如何?
  • RQ5基于赌博机的机制是否能减少达到最优解所需的适应度评估次数,特别是在噪声环境下?

主要发现

  • 在噪声OneMax问题中,基于赌博机的RMHC相比标准RMHC将适应度评估次数减少了高达十倍。
  • 当重采样次数为2时,OneMax与Royal Road问题中总适应度评估次数几乎与问题规模呈线性关系。
  • 在8×8的Royal Road问题中,基于赌博机的RMHC所用的函数评估次数仅为Mitchell等人报告的最高效RMHC变体的一半。
  • 该算法在不同问题规模和块配置下均保持稳定性能,在无噪声和有噪声环境下均优于标准RMHC。
  • 基于UCB的选择机制有效平衡了探索与利用,即使在噪声环境中也能防止过早收敛。
  • 在基于赌博机的选择下,平均适应度评估次数与问题规模的比值保持稳定;而标准RMHC在重采样次数较小时该比值持续上升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。