Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Acceleration of the GPU Fourier Domain Acceleration Search Algorithm

Karel Adámek, Sofia Dimoudi|arXiv (Cornell University)|2017. 11. 29.
Radio Astronomy Observations and Technology인용 수 7
한 줄 요약

이 논문은 고유의 FFT 커널과 향상된 컨볼루션 루틴을 사용하여 GPU 기반의 푸리에 도메인 가속 검색(Fourier Domain Acceleration Search, FDAS) 알고리즘을 최적화한 구현을 제시한다. 이로 인해 이전 최고 성능 구현 대비 44% 빠른 성능을 달성했으며, NVIDIA P100에서 cuFFT 기반 방법 대비 최대 3.9배의 성능 향상을 이룩했다. 성능 향상의 핵심은 스레드 수준의 데이터 재사용 향상, 샐프 지시어 감소, 스레드당 FFT 원소 수 증가로, 이는 라디오 천문학 신호 처리에서 더 큰 필터 크기와 높은 계산 효율성을 가능하게 했다.

ABSTRACT

We present an improvement of our implementation of the Correlation Technique for the Fourier Domain Acceleration Search (FDAS) algorithm on Graphics Processor Units (GPUs) (Dimoudi & Armour 2015; Dimoudi et al. 2017). Our new improved convolution code which uses our custom GPU FFT code is between 2.5 and 3.9 times faster the than our cuFFT-based implementation (on an NVIDIA P100) and allows for a wider range of filter sizes then our previous version. By using this new version of our convolution code in FDAS we have achieved 44% performance increase over our previous best implementation. It is also approximately 8 times faster than the existing PRESTO GPU implementation of FDAS (Luo 2013). This work is part of the AstroAccelerate project (Armour et al. 2002), a many-core accelerated time-domain signal processing library for radio astronomy.

연구 동기 및 목표

  • 라디오 천문학 데이터에서 이중성 펄서를 탐지하기 위해 푸리에 도메인 가속 검색(Fourier Domain Acceleration Search, FDAS) 알고리즘의 처리 속도를 향상시키는 것.
  • GPU에서의 컨볼루션 연산에서 발생하는 성능 저하 문제를 해결하기 위해 FFT 및 컨볼루션 커널을 GPU 기반으로 최적화하는 것.
  • 메모리 접근 및 계산 효율성 향상을 통해 FDAS에서 사용 가능한 필터 크기의 범위를 확장하는 것.
  • 대규모 라디오 천체망 관측 데이터 처리에서 계산 비용과 에너지 소비를 줄이기 위해 GPU 커널 성능을 향상시키는 것.

제안 방법

  • 스레드당 다수의 FFT 원소를 계산하여 데이터 재사용을 향상시키고, 중복된 twiddle 인자 계산을 줄이기 위해 고유의 GPU FFT 커널을 개발하였다.
  • GPU 샐프 지시어를 활용해 워프 내 데이터 교환을 가속화하여, 동기화 오버헤드를 감소시키고 소형 FFT 크기(N ≤ 32)에서 성능을 향상시켰다.
  • 긴 시간 시리즈를 세그먼트로 나누어 독립적으로 컨볼루션을 수행하는 오버랩-앤드-세이브 방법을 적용하여 효율적인 GPU 병렬 처리를 가능하게 하였다.
  • 공유 메모리 사용과 글로벌 메모리 접근 최소화를 통해 컨볼루션 커널을 최적화하여 대역폭에 의해 제한되는 구조로 만들었다.
  • 향상된 FFT 및 컨볼루션 루틴을 FDAS 파이프라인에 통합하여 알고리즘 특화의 대칭성을 활용해 레지스터 사용량을 줄이고, 스레드 수용률을 향상시켰다.
  • P100 및 TITAN X 등의 다양한 GPU 아키텍처에서 다양한 필터 길이에 대해 성능을 벤치마킹하였으며, cuFFT 및 이전의 고유 FFT 구현과의 비교를 수행하였다.

실험 결과

연구 질문

  • RQ1FFT 및 컨볼루션 커널의 저수준 최적화를 통해 GPU 기반 FDAS 알고리즘의 성능을 어떻게 향상시킬 수 있는가?
  • RQ2더 높은 데이터 재사용과 샐프 지시어 활용을 갖춘 고유 GPU FFT 커널이 FDAS 환경에서 표준 cuFFT 라이브러리보다 얼마나 뛰어난 성능을 보일 수 있는가?
  • RQ3스레드당 계산하는 FFT 원소 수를 늘릴 경우, 커널 수용률과 전체 성능에 어떤 영향을 미치는가?
  • RQ4향상된 컨볼루션 커널은 더 큰 필터 크기를 지원하면서도 고성능을 유지할 수 있으며, 이는 가속화된 펄서의 탐지 민감도에 어떤 영향을 미치는가?

주요 결과

  • 새로운 고유 FFT 커널은 P100에서 이전 버전 대비 20% 향상된 성능을 기록했으며, TITAN X에서는 50% 향상된 성능를 달성했다.
  • 새로운 FFT 커널을 사용한 최적화된 컨볼루션 코드는 이전 최고 성능의 FDAS 구현 대비 44% 빠른 성능을 보였다.
  • 새로운 구현은 NVIDIA P100 GPU에서 cuFFT 기반 구현 대비 최대 3.9배의 성능 향상을 달성했다.
  • 개선된 코드로 인해 최대 필터 크기가 2048 원소로 확장되어 더 긴 매칭 필터를 구현하고 탐지 민감도를 향상시킬 수 있게 되었다.
  • 공유 메모리 기반 컨볼루션 커널은 공유 메모리 대역폭에 의해 제한되는 구조로 전환되어 글로벌 메모리 의존도를 감소시키고 효율성을 향상시켰다.
  • 알고리즘 특화 최적화(레지스터 사용량 감소, 높은 커널 수용률 포함) 덕분에 전체 FDAS 파이프라인에서 성능 향상 효과가 더욱 두드러졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.