Skip to main content
QUICK REVIEW

[论文解读] Hierarchical QR factorization algorithms for multi-core cluster systems

Jack Dongarra, Mathieu Faverge|arXiv (Cornell University)|Oct 7, 2011
Parallel Computing and Optimization Techniques被引用 4
一句话总结

本文提出HQR,一种专为多核集群系统设计的分层QR分解算法,通过结合三级集群内归约树(TS级、低级、耦合级)与集群间FlatTree归约,最小化通信开销并最大化性能。该算法基于DAGuE调度框架实现,在方形矩阵上达到理论峰值性能的68.7%,显著优于ScaLAPACK、[BDD+10]和[SLHD10]在所有矩阵形状下的表现。

ABSTRACT

This paper describes a new QR factorization algorithm which is especially designed for massively parallel platforms combining parallel distributed multi-core nodes. These platforms make the present and the foreseeable future of high-performance computing. Our new QR factorization algorithm falls in the category of the tile algorithms which naturally enables good data locality for the sequential kernels executed by the cores (high sequential performance), low number of messages in a parallel distributed setting (small latency term), and fine granularity (high parallelism).

研究动机与目标

  • 解决现代分层多核集群系统(具有分布式内存)中QR分解的性能瓶颈。
  • 通过设计通信避免算法,降低大规模并行QR分解中的处理器间通信开销。
  • 通过灵活、模块化的基于分块的算法与分层归约树,提升数据局部性与并行性。
  • 利用DAGuE调度框架,实现面向百亿亿级(petascale)与百亿亿亿级(exascale)平台的高效、可移植且自动化的QR分解实现。

提出的方法

  • 该算法采用具有三级集群内层级的分层归约树结构:TS级用于提升缓存友好性,低级用于解耦节点间归约,耦合级用于同步本地与全局归约。
  • 在集群间层级采用FlatTree结构,以最小化节点间通信量,降低分布式内存环境下的延迟项。
  • 设计支持多种内核类型、数据分布布局及所有层级可自定义的归约树结构,实现灵活性与模块化。
  • 算法基于DAGuE调度工具实现,可自动处理任务调度,并充分利用核心与节点间的细粒度并行性。
  • 基于分块的方法将矩阵划分为小型计算单元(分块),在核心上实现高序列性能,并支持高效的负载均衡。
  • 支持一维与二维数据分布,通过动态优化(如多米诺耦合)避免负载不均与饥饿现象。

实验结果

研究问题

  • RQ1如何针对兼具共享内存节点与分布式内存互连的分层多核集群系统优化QR分解?
  • RQ2何种分层归约树结构可在最小化通信量的同时最大化并行性与数据局部性?
  • RQ3不同集群内与集群间归约树组合对不同矩阵形状(从高瘦型到方形)的性能影响如何?
  • RQ4灵活、模块化的算法设计在百亿亿级与百亿亿亿级平台上的性能与可移植性提升程度如何?
  • RQ5DAGuE框架能否有效自动化实现复杂、通信避免型QR分解算法?

主要发现

  • 在高瘦型矩阵(240×4分块)上,HQR达到理论峰值性能的57.5%,相比ScaLAPACK(6.4%)、[BDD+10](18.3%)和[SLHD10](43.5%)最高提升达9.0倍。
  • 在方形矩阵(240×240分块)上,HQR达到峰值性能的68.7%,显著超过ScaLAPACK(44.2%)、[BDD+10](62.2%)和[SLHD10](46.7%),最高提升达1.5倍。
  • 三级集群内归约树(TS级、低级、耦合级)均对性能有显著贡献,其中耦合级在协调本地与全局归约交互中起关键作用。
  • FlatTree集群间归约显著降低通信量并提升可扩展性,尤其在列数较多的矩阵上表现更优。
  • 该算法的灵活性支持动态优化,例如在并行度足够时禁用多米诺耦合,提升效率而不牺牲负载均衡。
  • 基于DAGuE的实现支持自动化、可移植且高效的跨异构硬件部署,证明了在百亿亿级平台上实现高性能、可扩展QR分解的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。