Skip to main content
QUICK REVIEW

[논문 리뷰] On the Feasibility of FPGA Acceleration of Molecular Dynamics Simulations

Michael Schaffner, Luca Benini|arXiv (Cornell University)|2018. 08. 08.
Parallel Computing and Optimization Techniques인용 수 8
한 줄 요약

이 논문은 실제 워크로드 벤치마크를 사용하여 FPGA 기반 및 GPU 기반 시스템을 비교함으로써 고전적 분자역학(MD) 시뮬레이션에 대한 FPGA 가속을 평가한다. FPGA는 GPU 대비 최대 2배의 애플리케이션 수준 성능 향상을 달성할 수 있으나, 이 성능 향상은 높은 비용과 소프트웨어 오버헤드로 인해 상쇄되며, 순수한 FPGA 솔루션은 상용적으로 타당성이 없다고 결론내린다. 그러나 저지연 통신 작업을 위한 FPGA 활용을 통한 하이브리드 아키텍처는 대규모 MD 워크로드에서 잠재력을 보인다.

ABSTRACT

Classical molecular dynamics (MD) simulations are important tools in life and material sciences since they allow studying chemical and biological processes in detail. However, the inherent scalability problem of particle-particle interactions and the sequential dependency of subsequent time steps render MD computationally intensive and difficult to scale. To this end, specialized FPGA-based accelerators have been repeatedly proposed to ameliorate this problem. However, to date none of the leading MD simulation packages fully support FPGA acceleration and a direct comparison of GPU versus FPGA accelerated codes has remained elusive so far. With this report, we aim at clarifying this issue by comparing measured application performance on GPU-dense compute nodes with performance and cost estimates of a FPGA-based single- node system. Our results show that an FPGA-based system can indeed outperform a similarly configured GPU-based system, but the overall application-level speedup remains in the order of 2x due to software overheads on the host. Considering the price for GPU and FPGA solutions, we observe that GPU-based solutions provide the better cost/performance tradeoff, and hence pure FPGA-based solutions are likely not going to be commercially viable. However, we also note that scaled multi-node systems could potentially benefit from a hybrid composition, where GPUs are used for compute intensive parts and FPGAs for latency and communication sensitive tasks.

연구 동기 및 목표

  • 고전적 분자역학(MD) 시뮬레이션에 대한 FPGA 가속의 타당성을 GPU 기반 솔루션과 비교하여 평가하는 것.
  • 일반적인 MD 워크로드에서 FPGA 기반 시스템이 GPU 기반 시스템보다 성능 및 비용 효율성 측면에서 뛰어나다는지 평가하는 것.
  • 대규모 다중 노드 MD 시뮬레이션에서 하이브리드 FPGA-GPU 아키텍처의 잠재력을 조사하는 것.
  • 특히 통신 및 PME(입자 메쉬 에우일러) 단계에서 GPU 가속 MD의 시스템 수준 버티브레인을 규명하는 것.
  • 분산 MD 시뮬레이션에서 확장성을 향상시키기 위해 FPGA를 근접 네트워크 가속기로 사용할 수 있는지 탐색하는 것.

제안 방법

  • 기준 성능를 확보하기 위해 GPU 집약적 컴퓨팅 노드에서 널리 사용되는 두 가지 GPU 기반 MD 소프트웨어 패키지인 GROMACS와 AMBER를 벤치마크했다.
  • 현재의 FPGA 기술을 기반으로 비결합 상호작용 계산 및 힘 장 평가에 중점을 둔 FPGA 기반 가속기 아키텍처를 모델링했다.
  • FPGA 기반 단일 노드 시스템의 애플리케이션 수준 성능와 비용을 추정하고, 유사하게 구성된 GPU 기반 시스템과 직접 비교했다.
  • GPU 기반 MD에서의 통신 버티브레인, 특히 PME 및 전역 감소 단계를 핵심 대상으로 삼아 FPGA 오프로딩을 분석했다.
  • 2D/3D 토러스 또는 스타 토폴로지와 같은 아키텍처 대안을 고려하여 다중 노드 시스템에서의 노드 간 통신을 가속화하는 FPGA 네트워크 카드의 잠재력을 탐색했다.
  • 이전의 FPGA 기반 FFT 및 네트워크 필터링 연구를 영감으로 삼아, 에너지 및 비리얼 감소와 같은 저지연성 작업을 위한 FPGA 기반 네트워크 내 가속 가능성 평가

실험 결과

연구 질문

  • RQ1FPGA 기반 가속이 고전적 MD 시뮬레이션에서 GPU 기반 가속보다 더 높은 애플리케이션 수준 성능을 달성할 수 있는가?
  • RQ2단일 노드 시스템에서 MD 워크로드에 대한 FPGA와 GPU 솔루션 간 성능 및 비용의 트레이드오프는 어떠한가?
  • RQ3PME 또는 전역 감소와 같은 통신 집약적인 단계에서 FPGA 가속이 측정 가능한 이점을 제공할 수 있는가?
  • RQ4하이브리드 FPGA-GPU 아키텍처는 대규모 다중 노드 MD 시뮬레이션에서 확장성을 향상시킬 수 있는가?
  • RQ5FPGA의 소프트웨어 오버헤드와 유연성의 감소가 MD 워크로드에서 잠재적인 하드웨어 이점을 상쇄할 수 있는가?

주요 결과

  • 유사하게 구성된 GPU 기반 시스템 대비 FPGA 기반 시스템은 힘 계산의 최적화된 하드웨어 실행 덕분에 최대 2배의 애플리케이션 수준 성능 향상을 달성할 수 있다.
  • 성능 향상에도 불구하고, 높은 소프트웨어 및 호스트 오버헤드로 인해 효과적인 이점은 제한된다.
  • GPU 기반 솔루션은 FPGA 기반 솔루션보다 훨씬 뛰어난 성능 대비 비용 비율을 제공하므로, 대부분의 MD 워크로드에 대해 순수한 FPGA 가속은 상용적으로 타당성이 없다.
  • GPU 기반 MD 시뮬레이션의 주요 버티브레인은 통신 단계에 있으며, 특히 PME 및 전역 감소 단계에서 노드 간 확장성이 떨어진다.
  • FPGA를 통신 및 저지연성 작업을 가속화하는 데 사용하는 하이브리드 아키텍처는 대규모 다중 노드 MD 시스템에서의 확장성 향상 잠재력을 보여준다.
  • PME 및 전역 감소와 같은 작업을 위한 FPGA 기반 네트워크 내 가속(예: PME 및 전역 감소를 위한 근접 네트워크 보조 처리기로 FPGA 사용)은 통신 버티브레인을 완화하고 대규모 클러스터에서의 강한 확장성 향상에 기여할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.