Skip to main content
QUICK REVIEW

[논문 리뷰] GPU-Based Fuzzy C-Means Clustering Algorithm for Image Segmentation

Mishal Almazrooie, Mogana Vadiveloo|arXiv (Cornell University)|2016. 01. 01.
Medical Image Segmentation Techniques참고 문헌 10인용 수 3
한 줄 요약

이 논문은 CUDA 기반 GPU에서 실행 가능한 Fuzzy C-Means (FCM) 군집화 알고리즘을 제안하며, 데이터 병렬 처리를 통해 고속 처리를 달성한다. 각 픽셀을 단일 GPU 스레드에 매핑함으로써, 1MB 크기의 뇌 MRI 데이터셋에 대해 순차적 처리 시 519초에서 2.33초로 실행 시간을 단축하여 약 245배의 성능 향상을 이뤘으며, 순차적 FCM와 유사한 분할 정확도를 유지한다.

ABSTRACT

In this paper, a fast and practical GPU-based implementation of Fuzzy C-Means(FCM) clustering algorithm for image segmentation is proposed. First, an extensive analysis is conducted to study the dependency among the image pixels in the algorithm for parallelization. The proposed GPU-based FCM has been tested on digital brain simulated dataset to segment white matter(WM), gray matter(GM) and cerebrospinal fluid (CSF) soft tissue regions. The execution time of the sequential FCM is 519 seconds for an image dataset with the size of 1MB. While the proposed GPU-based FCM requires only 2.33 seconds for the similar size of image dataset. An estimated 245-fold speedup is measured for the data size of 40 KB on a CUDA device that has 448 processors.

연구 동기 및 목표

  • 대규모 의료 영상 데이터셋을 처리할 때 순차적 Fuzzy C-Means (FCM) 군집화의 계산 비효율성을 해결하기 위해.
  • 일반 목적의 그래픽스 프로세싱 유닛(GPGPU)을 활용한 FCM의 병렬화 가능성과 성능 향상을 탐색하기 위해.
  • 실행 시간을 크게 단축하면서도 분할 정확도를 유지하는 확장 가능한 데이터 병렬 GPU 구현체를 개발하기 위해.
  • 모의 뇌 조직 펌프 데이터셋을 기반으로 정성적 및 정량적 평가 지표(예: Dice 유사도 계수(DSC))를 사용해 제안된 방법을 평가하기 위해.

제안 방법

  • 제안된 방법은 Tesla C2050 장치의 448개 GPU 프로세서에 걸쳐 세밀한 수준의 데이터 병렬 처리를 가능하게 하기 위해 각 영상 픽셀을 단일 CUDA 스레드에 매핑한다.
  • 알고리즘은 표준 FCM 목표 함수(식 1)를 구현하며, 반복적으로 클러스터 중심(식 3)과 소속도 값(식 4)을 병렬로 업데이트한다.
  • 소속도 값의 변화가 임계값 ε = 0.005 이하로 감소할 경우 수렴으로 간주한다.
  • 실행은 CUDA의 커널 실행 모델을 사용하여 GPU에서 소속도 및 클러스터 중심 업데이트 계산을 병렬로 실행한다.
  • 정확성과 검증을 위해 실행 시간 측정에는 gettimeofday()와 cudaEventRecord()를 사용한다.
  • 분할 정확도 평가는 지표로 DSC를 사용하며, 기준 데이터셋과의 비교를 통해 수행된다.

실험 결과

연구 질문

  • RQ1대규모 의료 영상 데이터셋 처리에 있어 GPU 기반 FCM가 순차적 FCM 대비 뚜렷한 성능 향상을 이룰 수 있는가?
  • RQ2병렬 FCM 구현체는 순차적 버전 대비 분할 정확도를 어떻게 유지하는가?
  • RQ320KB에서 1MB까지 다양한 영상 크기에서 GPU 기반 FCM의 확장성은 어떠한가?
  • RQ4실행 시간과 속도 향상 측면에서 제안된 GPU-FCM는 순차적 FCM에 비해 어떤 성능을 보이는가?

주요 결과

  • 제안된 GPU 기반 FCM는 1MB 이미지 데이터셋 처리 시 순차적 FCM 대비 약 245배의 성능 향상을 달성했다.
  • 40KB 데이터셋에서는 245배의 성능 향상이 있었고, 80KB에서는 169배로 감소하였으며, 300KB 이상의 데이터셋에서는 186~238배의 성능 향상이 유지되었다.
  • 1MB 데이터셋에 대해 제안된 방법의 실행 시간은 2.33초였고, 순차적 FCM2 구현체는 519초였다.
  • Dice 유사도 계수(DSC) 결과는 병렬 FCM의 분할 정확도가 모든 테스트 슬라이스(91번째, 96번째, 101번째, 111번째)에서 순차적 FCM와 통계적으로 유의미하게 차이가 없음을 보여주었다.
  • 실행 시간이 영상 크기에 따라 선형적으로 증가하는 등 강력한 확장성을 보였으며, 대용량 데이터셋에서도 높은 성능 유지를 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.