Skip to main content
QUICK REVIEW

[论文解读] GPU-Based Parallel Computing Methods for Medical Photoacoustic Image Reconstruction

Xinyao Yi, Yuxin Qiao|arXiv (Cornell University)|Apr 16, 2024
Photoacoustic and Ultrasonic Imaging被引用 4
一句话总结

本文提出了一种基于CUDA的GPU加速并行计算方法,用于加速迭代光声成像重建,通过优化内存访问并行化矩阵运算,在保持重建精度的同时,使处理速度相比CPU提升了5.9倍,实现了肿瘤学和血流动力学领域实时临床应用的可行性。

ABSTRACT

Recent years have witnessed a rapid advancement in GPU technology, establishing it as a formidable high-performance parallel computing technology with superior floating-point computational capabilities compared to traditional CPUs. This paper explores the application of this technology in the field of photoacoustic imaging, an emerging non-destructive testing technique in biomedical engineering characterized by its high contrast, resolution, and penetration depth. We conduct a data parallelism analysis targeting the computationally intensive image reconstruction segment of photoacoustic imaging. By parallelizing the serial code for iterative reconstruction and optimizing memory access, we achieve significant improvements in processing speed. Our experiments compare the imaging speeds of vascular images reconstructed using CPUs and GPUs, with the results visualized using Matlab. The findings demonstrate that, while maintaining data accuracy, GPU parallel computing methods can markedly accelerate photoacoustic image reconstruction. This acceleration has the potential to facilitate the broader adoption of photoacoustic imaging in applications such as hemodynamic monitoring, clinical disease diagnosis, and drug development.

研究动机与目标

  • 解决由于数据量大和迭代算法复杂导致的光声成像重建计算瓶颈。
  • 利用GPU硬件优势——尤其是大规模并行处理能力和高内存带宽——超越传统的基于CPU的重建方法。
  • 通过优化内存访问模式和数据划分,最大化GPU利用率,降低迭代重建工作流中的延迟。
  • 通过加速重建速度,在不牺牲精度的前提下,证明实现实时光声成像的可行性。
  • 通过性能提升,推动光声成像在血流动力学监测、疾病诊断和药物研发中的广泛应用。

提出的方法

  • 将串行迭代重建代码移植到CUDA编程模型,以利用GPU的大规模并行处理能力。
  • 通过数据并行化,将矩阵运算划分为分块处理,由GPU流式多处理器同时执行。
  • 使用共享内存优化内存访问,降低全局内存延迟,并在矩阵乘法过程中提高数据局部性。
  • 采用分块策略,将输入矩阵划分为较小的块,加载到共享内存中以实现重复重用。
  • 使用CUDA内核在块子集上执行并行累加操作,最大限度减少冗余的全局内存访问。
  • 通过调用CUDA函数并对比GPU与CPU重建输出的一致性,使用MATLAB验证结果。

实验结果

研究问题

  • RQ1与基于CPU的方法相比,基于GPU的并行计算是否能显著缩短迭代光声成像重建所需时间?
  • RQ2在GPU加速的光声成像重建中,如何优化内存访问模式以提升性能并减少延迟?
  • RQ3数据并行化和分块策略在矩阵密集型重建算法中能在多大程度上提升计算效率?
  • RQ4在重建具有临床意义的血管图像帧时,GPU相对于CPU可实现的加速比是多少?
  • RQ5GPU加速是否能在保持重建精度的同时,实现适合实时医学成像应用的快速处理?

主要发现

  • GPU在重建三个127×127的光声图像帧时实现了5.9倍的加速,将重建时间从CPU的约118秒缩短至GPU的约20秒。
  • 在GPU上,矩阵乘法操作相比CPU实现了6倍的加速,6144×16384 × 16384×16384的矩阵乘法在CPU上耗时42.3秒,而在GPU上仅需7.8秒。
  • GPU和CPU重建的图像在视觉和数值上完全一致,证实了加速过程中精度得以保持。
  • 通过共享内存分块优化内存访问,显著降低了内存访问延迟,并在迭代重建过程中提升了数据局部性。
  • 基于CUDA的实现成功并行化了计算密集型的重建阶段,展示了在更大图像数据集上的可扩展性。
  • 结果表明,该方法在临床环境中实现实时光声成像具有巨大潜力,尤其适用于动态监测和诊断应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。