[论文解读] Learning Robust Search Strategies Using a Bandit-Based Approach
本文提出了一种基于Bandit的在线学习方法,用于在约束满足问题(CSP)求解过程中自动选择多个变量排序启发式策略。通过将启发式选择建模为多臂赌博机(MAB)问题,并利用UCB1和Thompson Sampling算法结合搜索失败的奖励反馈,该方法能够动态适应问题结构,在多种CSP基准测试中实现比单一启发式策略更稳健且通常更快的性能表现。
Effective solving of constraint problems often requires choosing good or specific search heuristics. However, choosing or designing a good search heuristic is non-trivial and is often a manual process. In this paper, rather than manually choosing/designing search heuristics, we propose the use of bandit-based learning techniques to automatically select search heuristics. Our approach is online where the solver learns and selects from a set of heuristics during search. The goal is to obtain automatic search heuristics which give robust performance. Preliminary experiments show that our adaptive technique is more robust than the original search heuristics. It can also outperform the original heuristics.
研究动机与目标
- 为解决手动选择或设计约束满足问题(CSPs)有效搜索启发式策略的挑战,该挑战耗时且依赖于具体问题。
- 开发一种在线自适应学习机制,在搜索过程中从多个现有启发式策略中进行选择,而非依赖单一固定启发式策略。
- 通过实时学习搜索反馈,提升求解器在多样化CSP实例上的鲁棒性和性能表现。
- 减少对专家调优的依赖,使求解器能够在执行过程中自动确定最佳启发式策略。
提出的方法
- 将变量排序启发式策略的选择建模为多臂赌博机(MAB)问题,其中每个启发式策略被视为一个‘臂’。
- 使用UCB1和Thompson Sampling算法在搜索过程中平衡探索与利用,以优化启发式策略选择。
- 基于搜索性能定义奖励函数:节点处的失败被视作对导致该失败的启发式策略的奖励,从而引导未来的策略选择。
- 在求解过程中在线收集反馈——无需离线训练或标注样本——使该方法适用于实时自适应。
- 将基于MAB的启发式选择器集成到CP求解器中,实现在每个搜索节点动态切换候选启发式策略(例如:ddeg/dom、wdeg/dom、activity、impact、corr)。
- 在非二元CSP基准上评估该方法,与单一启发式策略及随机基线进行比较。
实验结果
研究问题
- RQ1基于Bandit的在线学习方法能否动态选择变量排序启发式策略,从而提升在多样化CSP实例上的鲁棒性?
- RQ2与单一启发式策略相比,MAB-based启发式选择在求解时间与不同问题族的方差方面表现如何?
- RQ3自适应选择机制是否能降低因选择低效启发式策略而导致性能指数级退化的风险?
- RQ4MAB框架中启发式策略的使用频率与问题求解行为及性能之间是否存在相关性?
主要发现
- 基于MAB的启发式策略(UCB1与Thompson Sampling)显著降低了在不同问题族之间的性能方差,表现出更高的鲁棒性。
- 在许多问题实例中,MAB-based方法的表现优于表现最佳的单一启发式策略,实现了更短的求解时间与更少的搜索节点探索。
- 对于BIBD实例,尽管activity启发式单独使用时表现最差,但UCB1与Thompson Sampling均最频繁地选择了它,表明自适应学习机制识别到了其在特定上下文中的有益使用场景。
- 与MAB方法相比,顺序PSS(sPSS)基线方法慢得多,在rand3-20-20-1上总搜索节点数达507K,而MAB-UCB1仅为73K,这是由于需顺序求解所有子问题导致的高开销。
- 在ruler-34-9-a4上,sPSS的总运行时间为116.8秒,而MAB-UCB1仅为6.9秒,表明sPSS在缺乏足够并行性时效率低下。
- sPSS的性能对分解策略高度敏感,表明其鲁棒性低于基于MAB的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。