[논문 리뷰] Revisiting FPGA Acceleration of Molecular Dynamics Simulation with Dynamic Data Flow Behavior in High-Level Synthesis
이 논문은 고수준 합성(HLS)을 활용한 분자역학(MD) 시뮬레이션의 FPGA 가속을 재검토하며, HLS 도구에서 지원하지 않는 동적(조건부) 데이터 흐름 행동이 RTL 대비 성능을 2배 이하로 저하시킨다는 점을 규명한다. 데이터 기반 스트리밍과 PE 어레이 커스터마이제이션을 가능하게 하는 자동화된 RTL 템플릿 기반 플로우를 도입함으로써, ApoA1 벤치마크에서 12코어 CPU 대비 19.4배의 속도 향상과 39배의 에너지 효율 향상을 달성하였다. Convey HC1ex FPGA에서 수행됨.
Molecular dynamics (MD) simulation is one of the past decade's most important tools for enabling biology scientists and researchers to explore human health and diseases. However, due to the computation complexity of the MD algorithm, it takes weeks or even months to simulate a comparatively simple biology entity on conventional multicore processors. The critical path in molecular dynamics simulations is the force calculation between particles inside the simulated environment, which has abundant parallelism. Among various acceleration platforms, FPGA is an attractive alternative because of its low power and high energy efficiency. However, due to its high programming cost using RTL, none of the mainstream MD software packages has yet adopted FPGA for acceleration. In this paper we revisit the FPGA acceleration of MD in high-level synthesis (HLS) so as to provide affordable programming cost. Our experience with the MD acceleration demonstrates that HLS optimizations such as loop pipelining, module duplication and memory partitioning are essential to improve the performance, achieving a speedup of 9.5X compared to a 12-core CPU. More importantly, we observe that even the fully optimized HLS design can still be 2X slower than the reference RTL architecture due to the common dynamic (conditional) data flow behavior that is not yet supported by current HLS tools. To support such behavior, we further customize an array of processing elements together with a data-driven streaming network through a common RTL template, and fully automate the design flow. Our final experimental results demonstrate a 19.4X performance speedup and 39X energy efficiency for the widely used ApoA1 MD benchmark on the Convey HC1ex FPGA compared to a 12-core Intel Xeon server.
연구 동기 및 목표
- 개발 시간을 단축하기 위해 고수준 합성(HLS)을 활용해 FPGA 기반 MD 가속의 높은 프로그래밍 비용 문제를 해결한다.
- MD 시뮬레이션에서 발생하는 동적(조건부) 데이터 흐름 행동에 대한 지원 부족으로 인해 HLS 도구에서 발생하는 성능 저하 요인을 규명하고 진단한다.
- 재사용 가능한 RTL 템플릿을 통해 HLS에서 생성된 설계에 동적 데이터 흐름 지원을 확장하기 위한 자동화된 설계 플로우를 개발한다.
- 수동으로 최적화된 RTL 설계 수준의 성능과 에너지 효율성을 유지하면서도 HLS 수준의 프로그래머블성을 확보한다.
- 제안된 플로우가 Convey HC1ex FPGA 플랫폼에서 널리 사용되는 ApoA1 MD 벤치마크에 대해 효과적으로 적용되었음을 입증한다.
제안 방법
- MD 힘 계산 커널의 단순한 HLS 구현에서 시작하여, 루프 파이프라인, 모듈 복제, 메모리 파artitioning 등의 HLS 최적화 기법을 단계적으로 적용한다.
- 공통된 RTL 템플릿을 사용해 처리 요소(PE) 어레이와 데이터 기반 스트리밍 네트워크를 커스터마이징하여 HLS 도구에서 원천적으로 지원하지 않는 동적 데이터 흐름 행동을 처리한다.
- 향상된 RTL 아키텍처를 HLS 설계 플로우에 자동으로 통합함으로써, 사용자가 HLS 환경에 머무르며도 RTL 수준의 성능을 확보할 수 있도록 한다.
- 성능과 면적 오버헤드의 균형을 맞추기 위해 복제된 거리 계산 모듈 및 힘 계산 모듈의 수를 다양하게 변화시켜 설계 공간을 최적화한다.
- 최종 설계를 Convey HC1ex FPGA에 구현하고, 12코어 인텔 Xeon 서버와의 성능 및 에너지 효율성을 비교 평가한다.
실험 결과
연구 질문
- RQ1고수준 합성(HLS)만으로도 MD 시뮬레이션 가속에 있어 수동 최적화된 RTL 설계 수준의 성능을 달성할 수 있는가?
- RQ2동적 데이터 흐름 행동을 포함한 MD 시뮬레이션을 대상으로 할 때 현재의 HLS 도구에서 나타나는 주요 성능 제약 요소는 무엇인가?
- RQ3MD 힘 계산에서 흔히 발생하는 동적(조건부) 데이터 흐름 행동은 어떻게 HLS에서 생성된 설계에 효과적으로 지원할 수 있는가?
- RQ4수동 RTL 코딩 없이도 최적화된 HLS와 기준 RTL 아키텍처 사이의 성능 격차를 메울 수 있는 자동화된 설계 플로우는 가능한가?
- RQ5HLS와 대상에 맞는 RTL 수준의 개선을 조합함으로써 어떤 성능 및 에너지 효율 향상 효과를 달성할 수 있는가?
주요 결과
- 최적화된 전체 HLS 설계는 12코어 인텔 Xeon CPU 대비 9.5배의 속도 향상을 달성하여, 루프 파이프라인 및 모듈 복제 등의 HLS 최적화 기법의 효과를 입증하였다.
- 모든 HLS 최적화를 거친 후에도, 지원하지 않는 동적 데이터 흐름 행동으로 인해 참조 RTL 설계 대비 성능이 2배 느려졌으며, 이는 힘 계산 PE의 활용도가 약 25%에 머무름으로써 낮아진 결과였다.
- 데이터 기반 스트리밍 및 PE 어레이 구성에 특화된 커스터마이즈된 RTL 템플릿 도입으로 처리 요소의 전면 활용이 가능해져 성능 격차가 완전히 제거되었다.
- 최종적인 HLS-RTL 하이브리드 설계는 Convey HC1ex FPGA에서 12코어 CPU 서버 대비 19.4배의 속도 향상과 39배의 높은 에너지 효율 향상을 달성하였다.
- 설계 공간 탐색 결과, 힘 계산 모듈당 거리 계산 모듈을 4개 복제하는 것이 면적 대비 성능을 최적화하는 데 가장 적합했으며, 이로 인해 2.5배의 속도 향상과 25%의 면적 오버헤드를 기록하였다.
- 제안된 자동화 플로우는 최소한의 수동 RTL 작업으로 고성능 가속기를 성공적으로 생성하였으며, 고수준 프로그래밍 모델을 기반으로 한 실용적인 MD 시뮬레이션의 FPGA 가속을 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.