Skip to main content
QUICK REVIEW

[论文解读] ICON Challenge on Algorithm Selection

Lars Kotthoff|arXiv (Cornell University)|Nov 12, 2015
Scheduling and Optimization Algorithms被引用 5
一句话总结

本论文介绍了算法选择的ICON挑战赛,这是一项基准测试计划,评估了11个算法选择系统在13个ASlib场景中的表现,每个场景使用10次自助采样分割。优胜系统zilla获得了最低的归一化得分(0.366),比其他系统领先超过63%的差距,接近单一最佳求解器的性能,结果显示其在多次自助采样评估中具有高度稳定性。

ABSTRACT

We present the results of the ICON Challenge on Algorithm Selection.

研究动机与目标

  • 使用标准化基准在真实世界环境中评估和比较算法选择系统。
  • 评估预处理、特征选择和超参数调优对系统性能的影响。
  • 利用ASlib框架建立公平且可复现的算法选择基准。
  • 分析在多个训练/测试分割中性能差异的稳定性和显著性。
  • 识别表现最佳的系统,并突出展示zilla和ASAP_RF等创新方法。

提出的方法

  • 在13个ASlib场景中使用每场景10次自助采样训练/测试分割对系统进行评估,未进行分层处理。
  • 对于每个分割,使用虚拟最佳求解器(VBS)和单一最佳求解器(SB)通过公式 $ s_{norm} = \frac{s - s_{VBS}}{s_{SB} - s_{VBS}} $ 进行性能归一化,其中数值越低表示表现越好。
  • 在时间限制内应用预处理器;在预处理阶段解决的实例被排除在训练之外,并按相应方式评分。
  • 系统选择性地使用特征子集,仅在训练和测试集中保留相关特征。
  • 使用三种指标评估预测结果:PAR10得分的均值、误分类惩罚和求解实例数量。
  • 最终排名通过在全部130次评估(13个场景 × 10次分割)中归一化得分的平均值确定,并使用自助采样方法评估稳定性。

实验结果

研究问题

  • RQ1不同算法选择系统在多样化的真实世界ASlib场景中表现如何?
  • RQ2预处理和特征子集选择对系统性能和鲁棒性有何影响?
  • RQ3性能排名在多个训练/测试分割和自助样本中是否稳定?
  • RQ4未在文献中发表过的系统是否仍能取得顶尖表现?
  • RQ5超参数调优与模型架构对整体性能的相对贡献是什么?

主要发现

  • 优胜系统zilla的归一化得分为0.366,表明其性能差距缩小了63.4%至单一最佳求解器。
  • zillafolio排名第二,得分为0.370,与zilla的性能差异极小,表明其具有极强的鲁棒性。
  • Autofolio-48(训练时间48小时)提升至0.375,表明延长超参数搜索时间可显著提升性能。
  • ASAP_RF和llama-regrPairs等系统表现强劲,其中ASAP_RF在部分场景中优于所有其他系统。
  • 基于1,000次自助采样获得的置信区间证实了排名的高稳定性,前10名未发生显著变化。
  • SAT12-RAND和SAT12-IND场景尤为具有挑战性,部分系统在某些分割中的表现甚至低于单一最佳求解器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。