[论文解读] GPU-Based Fuzzy C-Means Clustering Algorithm for Image Segmentation
本文提出了一种基于GPU加速的模糊C-均值(FCM)聚类算法,用于医学图像分割,通过在CUDA支持的GPU上利用数据并行性实现高速处理。通过将每个像素映射到单个GPU线程,该方法将1MB脑部MRI数据集的处理时间从串行版本的519秒减少至仅2.33秒,实现了245倍的加速,同时保持了与串行FCM相当的分割精度。
In this paper, a fast and practical GPU-based implementation of Fuzzy C-Means(FCM) clustering algorithm for image segmentation is proposed. First, an extensive analysis is conducted to study the dependency among the image pixels in the algorithm for parallelization. The proposed GPU-based FCM has been tested on digital brain simulated dataset to segment white matter(WM), gray matter(GM) and cerebrospinal fluid (CSF) soft tissue regions. The execution time of the sequential FCM is 519 seconds for an image dataset with the size of 1MB. While the proposed GPU-based FCM requires only 2.33 seconds for the similar size of image dataset. An estimated 245-fold speedup is measured for the data size of 40 KB on a CUDA device that has 448 processors.
研究动机与目标
- 为解决串行模糊C-均值(FCM)聚类在处理大型医学图像数据集时的计算低效问题。
- 探索使用通用图形处理器计算(GPGPU)并行化FCM的可行性和性能提升。
- 开发一种可扩展的、基于数据并行的GPU实现FCM方法,保持分割精度的同时显著降低执行时间。
- 使用定性和定量指标(包括Dice相似性系数(DSC))对所提方法进行评估,数据集为模拟脑组织幻像数据。
提出的方法
- 所提方法将每个图像像素映射到单个CUDA线程,从而在Tesla C2050设备的448个GPU处理器上实现细粒度的数据并行。
- 该算法实现标准FCM目标函数(公式1),并行更新聚类中心(公式3)和隶属度值(公式4)。
- 当迭代间隶属度值的变化低于阈值ε = 0.005时,判定算法收敛。
- 实现采用CUDA的核函数启动模型,在GPU上并行执行隶属度和聚类中心更新计算。
- 执行时间通过gettimeofday()和cudaEventRecord()测量,以确保准确性和验证。
- 分割精度通过Dice相似性系数(DSC)评估,将结果与真实标签数据集进行比较。
实验结果
研究问题
- RQ1基于GPU的FCM实现能否在处理大型医学图像数据集时,相对于串行FCM实现显著加速?
- RQ2并行FCM实现与串行版本相比,其分割精度是否得以保持?
- RQ3该GPU加速FCM在不同图像尺寸(从20KB到1MB)下的可扩展性如何?
- RQ4在执行时间与加速比方面,所提GPU-FCM与串行FCM相比性能表现如何?
主要发现
- 在处理1MB图像数据集时,所提基于GPU的FCM相比串行FCM实现了245倍的加速。
- 对于40KB数据集,加速比达到245倍,80KB时下降至169倍,而在300KB以上数据集上保持186至238倍的加速比。
- 所提方法在1MB数据集上的执行时间为2.33秒,而串行FCM2实现为519秒。
- Dice相似性系数(DSC)结果显示,所有测试切片(第91、96、101、111切片)中,并行FCM的分割精度与串行FCM在统计上无显著差异。
- 该方法表现出良好的可扩展性,执行时间随图像尺寸线性增长,同时在大尺寸数据集上保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。