[论文解读] Benchmarking in Optimization: Best Practice and Open Issues
一份全面的综述,概述对基准测试优化算法的最佳实践指南,涵盖目标、问题集、算法、性能指标、分析、设计、呈现和可重复性,并指出未解决的问题以及周期性更新的路径。
This survey compiles ideas and recommendations from more than a dozen researchers with different backgrounds and from different institutes around the world. Promoting best practice in benchmarking is its main goal. The article discusses eight essential topics in benchmarking: clearly stated goals, well-specified problems, suitable algorithms, adequate performance measures, thoughtful analysis, effective and efficient designs, comprehensible presentations, and guaranteed reproducibility. The final goal is to provide well-accepted guidelines (rules) that might be useful for authors and reviewers. As benchmarking in optimization is an active and evolving field of research this manuscript is meant to co-evolve over time by means of periodic updates.
研究动机与目标
- 澄清在优化领域进行基准测试研究的目标与动机。
- 确定问题集和算法的理想特征与评估标准。
- 提供性能测量、数据分析、实验设计和结果呈现的指南。
- 解决基准测试中的可重复性和数据共享挑战。
- 提供一个可通过定期更新随领域发展演进的框架。
提出的方法
- 汇总来自全球各机构的多元研究者的建议。
- 将讨论围绕八个核心基准测试主题组织:目标、问题、算法、性能、分析、设计、呈现和可重复性。
- 将实际的最佳实践案例映射到每个主题,并突出未来工作的未解决问题。
实验结果
研究问题
- RQ1驱动优化基准测试研究的主要目标是什么?
- RQ2应如何选择、评估问题实例,并保持其具有代表性和多样性?
- RQ3基准测试中何种性能度量与分析是稳健且具有信息性的?
- RQ4应如何设计与报告实验以保证可重复性与可比性?
- RQ5基准测试最佳实践中还存在哪些未解决的问题,未来更新应如何处理?
主要发现
- 在优化中的基准测试应明确其目标,因为这些目标影响问题选择、算法、性能标准和统计量。
- 问题集必须多样、具代表性、可扩展,有时还需具有已知的真实值或最佳已知表现。
- 算法调优与理解需要谨慎的实验设计和稳健的统计工具,并关注参数鲁棒性。
- 性能外推和类似训练的用途(如 AutoML)是可行的,但需要对问题特征和实例选择进行谨慎处理。
- 可重复性取决于对算法/问题的精确描述、随机种子、数据格式和共享数据存储库;标准化仍是一个待解决的问题。
- 基准测试是理论与实践之间的桥梁,可以启发理论洞见和算法发展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。