Skip to main content
QUICK REVIEW

[论文解读] Performance Modeling for Dense Linear Algebra

Elmar Peise, Paolo Bientinesi|arXiv (Cornell University)|Sep 11, 2012
Machine Learning and Data Classification参考文献 6被引用 6
一句话总结

本文提出了一种用于密集线性代数例程性能建模的自动化框架,通过生成BLAS和LAPACK内核的统计模型。通过评估和组合这些模型,该方法在无需运行时执行的情况下,准确地对算法变体进行排序并调优块大小参数,在单核和多核系统上均实现了高预测精度。

ABSTRACT

It is well known that the behavior of dense linear algebra algorithms is greatly influenced by factors like target architecture, underlying libraries and even problem size; because of this, the accurate prediction of their performance is a real challenge. In this article, we are not interested in creating accurate models for a given algorithm, but in correctly ranking a set of equivalent algorithms according to their performance. Aware of the hierarchical structure of dense linear algebra routines, we approach the problem by developing a framework for the automatic generation of statistical performance models for BLAS and LAPACK libraries. This allows us to obtain predictions through evaluating and combining such models. We demonstrate that our approach is successful in both single- and multi-core environments, not only in the ranking of algorithms but also in tuning their parameters.

研究动机与目标

  • 自动生成准确的BLAS和LAPACK内核性能模型,作为高层算法的构建模块。
  • 在不执行代码的情况下,预测并排序密集线性代数中等效算法变体的性能。
  • 基于模型预测而非经验基准测试,优化算法配置,特别是块大小。
  • 在不同架构和问题规模下,实现对最快算法和最优参数的高效选择。

提出的方法

  • 开发一个名为Modeler的工具,自动基于实测数据生成BLAS内核的分析性能模型。
  • 基于不同问题规模和块大小的实测数据,构建性能指标(如效率)的分段多项式模型。
  • 将生成的模型存储在持久且可访问的仓库中,以供重用和评估。
  • 通过评估和组合其组成BLAS操作的性能模型,预测高层算法的性能。
  • 利用模型评估对算法变体进行排序,并识别最优块大小配置。
  • 根据使用场景,采用两种建模策略——优先考虑速度或精度。

实验结果

研究问题

  • RQ1能否自动生成足够准确的BLAS和LAPACK内核性能模型,以预测高层算法的性能?
  • RQ2这些模型能否在不执行运行时的情况下,正确地根据性能对密集线性代数操作的多个算法变体进行排序?
  • RQ3该框架能否准确预测给定算法和架构的最优块大小?
  • RQ4预测的性能排序在单核和多核系统上与实际测量结果的匹配程度如何?

主要发现

  • 性能模型准确预测了算法变体的相对效率,能够在不同问题规模和架构下正确排序。
  • 对于下三角矩阵求逆操作,模型正确识别出在大矩阵情况下变体3最为高效,与实验结果一致。
  • 模型预测变体1、2和3的最优块大小接近100,与观测到的性能峰值位置相符。
  • 在多核环境下,模型正确捕捉了不同变体间的性能交叉点,并预测在大矩阵规模下,变体1和2优于变体3。
  • 对于Sylvester方程求解器,模型成功将16个变体划分为高性能和低性能两组,并正确识别出前四名(变体1、2、5和6)为最优性能者。
  • 尽管单个模型存在不准确性,但组合预测在排序和配置调优方面表现出高预测能力,效率预测与实验测量结果高度吻合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。