Skip to main content
QUICK REVIEW

[论文解读] Fully Empirical Autotuned QR Factorization For Multicore Architectures

Emmanuel Agullo, Jack Dongarra|arXiv (Cornell University)|Feb 25, 2011
Parallel Computing and Optimization Techniques参考文献 17被引用 5
一句话总结

本文提出了一种用于多核架构上密集QR分解的完全基于经验的自动调优框架,通过运行时基准测试和强经验特性来缩减搜索空间。该方法在七个平台上实现了97–100%的峰值性能,其中五个平台的调优时间在10分钟以内完成,从而实现了PLASMA库的性能可移植性。

ABSTRACT

Tuning numerical libraries has become more difficult over time, as systems get more sophisticated. In particular, modern multicore machines make the behaviour of algorithms hard to forecast and model. In this paper, we tackle the issue of tuning a dense QR factorization on multicore architectures. We show that it is hard to rely on a model, which motivates us to design a fully empirical approach. We exhibit few strong empirical properties that enable us to efficiently prune the search space. Our method is automatic, fast and reliable. The tuning process is indeed fully performed at install time in less than one and ten minutes on five out of seven platforms. We achieve an average performance varying from 97% to 100% of the optimum performance depending on the platform. This work is a basis for autotuning the PLASMA library and enabling easy performance portability across hardware systems.

研究动机与目标

  • 为解决在现代多核架构上对密集QR分解进行调优的挑战,因为模型驱动的预测在复杂硬件行为下失效。
  • 开发一种自动、快速且可靠的调优过程,可在安装时完成,无需人工干预。
  • 通过识别和利用强经验特性来减少搜索空间,实现在多样化多核平台上的性能可移植性。
  • 为PLASMA库的自动调优奠定基础,并支持未来向异构架构和非方阵矩阵的扩展。

提出的方法

  • 该方法在安装时执行全面的经验基准测试,以测量可调参数(如块大小(NB)和内部块大小(IB))的性能。
  • 它利用强经验特性(如性能趋势的单调性和平滑性)来缩减搜索空间,避免完全枚举。
  • 使用简单的插值方法从基准测试结果构建决策树,实现在运行时的快速参数选择。
  • 该方法完全自动化,除使用批处理调度器的系统(如搭载LoadLeveler的IBM Power6)外,无需人工调优。
  • 调优仅限于每个安装的单台机器,结果在用户间共享,以避免重复调优。
  • 该框架设计用于扩展至混合多核-GPU系统和非方阵矩阵,未来工作将集中于异构平台上的统一调优。

实验结果

研究问题

  • RQ1在现代多核系统上,完全基于经验的方法是否能优于基于模型的调优方法用于密集QR分解?
  • RQ2哪些经验特性可以可靠地缩减自动调优的搜索空间而不牺牲性能?
  • RQ3在安装时,自动调优能在多快的时间内完成,同时在多样化架构上实现接近峰值性能?
  • RQ4该方法能否扩展以支持非方阵矩阵和混合多核-GPU系统?

主要发现

  • 在七个平台中的五个上,自动调优过程在10分钟内完成,所有系统上的完整调优时间均少于一小时。
  • 该方法在所有测试平台上的平均性能达到理论峰值性能的97%至100%。
  • 在IBM Power6系统上,该方法实现了100%的峰值性能,且无调优开销。
  • 该方法成功识别出所有测试矩阵尺寸和块配置的最优参数,在大多数情况下性能与最优值相差不超过1%。
  • 利用性能单调性等经验特性,有效缩减了搜索空间,减少了所需的基准测试次数。
  • 该框架具有可扩展性,为PLASMA库的自动调优以及未来异构架构奠定了基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。