Skip to main content
QUICK REVIEW

[论文解读] Multitask and Transfer Learning for Autotuning Exascale Applications

Wissam M. Sid-Lakhdar, Mohsen Mahmoudi Aznaveh|arXiv (Cornell University)|Aug 15, 2019
Machine Learning and Data Classification参考文献 29被引用 4
一句话总结

本文提出了一种多任务与迁移学习框架,用于exascale应用的自动调优,通过利用先前调优任务的知识来加速优化过程。该方法在OpenTuner和HpBandSter等最先进自动调优器的基础上,实现了平均1.5倍的运行时间提升,且在低预算配置下,即使在严格的资源约束条件下,其性能仍优于标准方法。

ABSTRACT

Multitask learning and transfer learning have proven to be useful in the field of machine learning when additional knowledge is available to help a prediction task. We aim at deriving methods following these paradigms for use in autotuning, where the goal is to find the optimal performance parameters of an application treated as a black-box function. We show comparative results with state-of-the-art autotuning techniques. For instance, we observe an average $1.5x$ improvement of the application runtime compared to the OpenTuner and HpBandSter autotuners. We explain how our approaches can be more suitable than some state-of-the-art autotuners for the tuning of any application in general and of expensive exascale applications in particular.

研究动机与目标

  • 解决由于单次运行计算成本高昂,导致在exascale应用中调优预算有限的挑战。
  • 克服在高成本exascale环境中,暴力网格搜索和标准自动调优器效率低下的问题。
  • 通过复用跨多样化工作负载的先前调优问题中的知识,实现更快、更准确的自动调优。
  • 开发一种可扩展、自适应的框架,支持多种调优指标、资源约束和增量学习。
  • 提升跨演进硬件和应用工作负载的性能可移植性与长期调优效率。

提出的方法

  • 提出一种多任务学习方法(MLA),同时联合优化多个问题实例,通过任务间共享信息以提升收敛速度。
  • 开发迁移学习算法(TLA1和TLA2),利用先前调优任务的预训练模型,以最少甚至无需新增运行来加速新调优任务。
  • 使用基于高斯过程的代理模型来表示调优参数的性能分布,从而实现高效的贝叶斯优化。
  • 设计一种黑箱自动调优接口,暴露输入参数、资源约束和优化指标,以支持应用组件间模块化、可组合的调优。
  • 实现分层调优流程,先进行初始模型训练(MLA),随后通过快速、低成本的推理(TLA1/TLA2)处理新任务。
  • 集成迁移机制,利用少量或无需额外评估,将预训练模型适配至新问题实例,从而减少对昂贵函数调用的依赖。

实验结果

研究问题

  • RQ1多任务学习能否在exascale应用的多样化问题实例中提升自动调优的效率与准确性?
  • RQ2迁移学习在多大程度上能减少达到最优参数配置所需的昂贵应用运行次数?
  • RQ3在低预算条件下,多任务与迁移学习方法与OpenTuner和HpBandSter等最先进自动调优器相比表现如何?
  • RQ4先前调优任务的知识能否在不从零开始重新训练的情况下,有效迁移到新的、未见过的问题实例上?
  • RQ5在典型的exascale工作负载中,面对噪声大、非平稳且不连续的性能指标,这些方法表现如何?

主要发现

  • 所提出的多任务学习方法(MLA)在66%的测试案例中优于OpenTuner,应用运行时间最高可提升40%。
  • TLA1(无运行迁移学习方法)实现了与OpenTuner和HpBandSter相当的性能,其配置达到或超过后两者。
  • TLA2仅使用100次应用运行,即在500×500 ScaLAPACK QR分解上实现了最优运行时间5.67e-3秒,优于使用100次运行的OpenTuner(7.00e-3秒),并接近网格搜索(5.15e-3秒)。
  • 与OpenTuner和HpBandSter相比,该框架将平均应用运行时间减少了1.5倍,展现出显著的效率提升。
  • 在低预算条件下,这些方法尤其有效,使其比标准自动调优器更适用于昂贵的exascale应用。
  • 实验结果证实,迁移学习可实现仅需极少或无需新评估的准确调优预测,验证了该框架的可扩展性与适应性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。