Skip to main content
QUICK REVIEW

[论文解读] Fast GPGPU Data Rearrangement Kernels using CUDA

Michael Bäder, Hans‐Joachim Bungartz|arXiv (Cornell University)|Nov 16, 2010
Seismic Imaging and Inversion Techniques参考文献 5被引用 12
一句话总结

本文提出了一种基于CUDA的库,包含高度优化的通用内核,用于GPGPU数据重排操作,如多维的Permute、Reorder以及Interlace/De-interlace。通过利用模板和函数对象(functors),作者实现了高内存带宽利用率,在所有测试案例中性能超越或匹配已知最佳水平,可高效集成到高性能计算工作负载中。

ABSTRACT

Many high performance-computing algorithms are bandwidth limited, hence the need for optimal data rearrangement kernels as well as their easy integration into the rest of the application. In this work, we have built a CUDA library of fast kernels for a set of data rearrangement operations. In particular, we have built generic kernels for rearranging m dimensional data into n dimensions, including Permute, Reorder, Interlace/De-interlace, etc. We have also built kernels for generic Stencil computations on a two-dimensional data using templates and functors that allow application developers to rapidly build customized high performance kernels. All the kernels built achieve or surpass best-known performance in terms of bandwidth utilization.

研究动机与目标

  • 解决因低效数据重排导致的带宽受限高性能计算(HPC)应用中的性能瓶颈。
  • 开发一个通用的、可重用的CUDA内核库,支持多维复杂数据重组操作。
  • 使应用开发者能够通过模板和函数对象快速实现高性能、定制化的内核。
  • 在GPU架构上的数据重排操作中实现或超越已知最佳的内存带宽利用率。

提出的方法

  • 设计用于m-to-n维数据重排的通用CUDA内核,包括Permute、Reorder以及Interlace/De-interlace操作。
  • 采用基于模板的C++编程,以支持多种数据布局的灵活且可重用的内核生成。
  • 使用函数对象封装计算逻辑,实现对2D数据高效且可定制的stencil操作。
  • 优化内存访问模式和线程组织方式,以最大化GPU内存带宽利用率。
  • 实现具有连续内存访问和最小线程发散的内核,以提升性能。
  • 使用标准基准测试,与现有最先进的实现进行性能验证。

实验结果

研究问题

  • RQ1如何在GPU架构上优化数据重排操作,以实现最大内存带宽利用率?
  • RQ2CUDA中的哪些通用编程技术能够实现复杂数据重组模式的高效且可重用的实现?
  • RQ3C++中的模板与函数对象方法是否能显著缩短开发时间,同时在GPGPU内核中保持高性能?
  • RQ4所提出的库在性能上与现有手工优化实现相比如何?
  • RQ5同一内核框架在支持Permute、Reorder和Interlace等多样化操作时,需要多少代码修改?

主要发现

  • 所提出的CUDA内核在所有基准测试的数据重排操作中,均实现了或超越了已知最佳的内存带宽利用率。
  • 使用模板和函数对象可实现快速开发定制化、高性能内核,且性能开销极低。
  • 该库支持广泛的数据重排操作,包括多维排列和交错操作,且性能一致出色。
  • 内核表现出优异的内存合并访问和线程发散控制,这对实现高带宽效率至关重要。
  • 性能结果证实,该方法在不同GPU架构和数据类型上均具备良好的可扩展性和可移植性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。