[논문 리뷰] Enabling Automated FPGA Accelerator Optimization Using Graph Neural Networks
이 논문은 그래프 신경망(GNN) 기반의 서rogate 모델인 GNN-DSE를 제안한다. 이 모델은 밀리초 내로 FPGA 고수준 합성(HLS) 성능을 예측하여 빠른 설계공간 탐색(DSE)을 가능하게 한다. 프로그램을 제어 흐름, 데이터 흐름, 콜 그래프, pragma 흐름을 포함한 그래프로 모델링함으로써 GNN는 지연, 자원 사용량 등 다양한 목표를 높은 정확도로 추정하며, 훈련 데이터가 적은 상태에서 새로운 커널에 대해 거의 최적에 가까운 성능을 달성한다.
High-level synthesis (HLS) has freed the computer architects from developing their designs in a very low-level language and needing to exactly specify how the data should be transferred in register-level. With the help of HLS, the hardware designers must describe only a high-level behavioral flow of the design. Despite this, it still can take weeks to develop a high-performance architecture mainly because there are many design choices at a higher level that requires more time to explore. It also takes several minutes to hours to get feedback from the HLS tool on the quality of each design candidate. In this paper, we propose to solve this problem by modeling the HLS tool with a graph neural network (GNN) that is trained to be used for a wide range of applications. The experimental results demonstrate that by employing the GNN-based model, we are able to estimate the quality of design in milliseconds with high accuracy which can help us search through the solution space very quickly.
연구 동기 및 목표
- HLS 설계 평가에 분당에서 수시간이 소요되는 장기적인 피드백 루프를 해결하기 위해.
- HLS 최적화에서 수많은 pragma 조합으로 인한 설계공간의 기하급수적 증가를 극복하기 위해.
- 느린 HLS 도구 호출에 의존하지 않고 자동화되고 확장 가능한 설계공간 탐색(DSE)을 가능하게 하기 위해.
- 훈련된 커널들로부터의 지식을 새로운 미사용 응용 프로그램으로 일반화할 수 있는 이식 가능한 모델을 개발하기 위해.
- 예측 정확도가 높고 파레토 최적의 설계 포인트를 유지하는 도구에 종속되지 않는 프레임워크를 구축하기 위해.
제안 방법
- 제어 흐름, 데이터 흐름, 콜 그래프, pragma 애너테이션을 포함한 이질적 그래프로 FPGA 설계를 표현하기 위해.
- 복잡한 비선형 상호작용을 포착하기 위해 점프 지식 네트워크(JKN), 노드 어텐션, 다중 헤드 예측을 사용한 GNN 훈련하기 위해.
- 각 설계당 밀리초 내로 핵심 HLS 목표(예: 지연, 자원 사용량)를 예측하기 위해 GNN을 서rogate 모델로 사용하기 위해.
- HLS 도구 평가를 통해 고품질 설계를 반복적으로 추출하여 훈련 데이터베이스를 확장하는 히우리스틱 기반 DSE 프레임워크 구현하기 위해.
- 기존 훈련 세트에 포함되지 않은 새로운 커널에 대해 GNN을 미세조정함으로써 전이 학습을 활용하여 도메인 간 일반화를 가능하게 하기 위해.
- 예측 성능 기반 순위 매기기를 통해 파레토 최적의 설계를 찾는 DSE 파이프라인에 GNN 모델 통합하기 위해.
실험 결과
연구 질문
- RQ1GNN 기반 서rogate 모델이 느린 HLS 도구 호출을 대체할 수 있을 정도로 밀리초 내로 HLS 성능 지표(지연, 자원 사용량)를 정확하게 예측할 수 있는가?
- RQ2제한된 수의 커널에서 훈련된 GNN 모델이 다른 도메인의 새로운, 미사용 커널으로 일반화되는 정도는 어느 정도인가?
- RQ3제안된 DSE 프레임워크는 브루트 포스나 히우리스틱 기반 탐색과 비교해 파레토 최적의 설계를 얼마나 효과적으로 찾는가?
- RQ4GNN 모델이 언롤 요인과 파이ipel라인과 같은 pragma 매개변수의 비단조화적이고 상관관계가 있는 영향을 효율적으로 처리할 수 있는가?
- RQ5전이 학습 통합이 새로운 응용 프로그램에 대한 HLS 평가 횟수를 크게 줄이는가?
주요 결과
- GNN-DSE 모델은 높은 정확도로 1밀리초 이내에 HLS 성능을 예측하여 평가 시간을 분에서 밀리초로 단축시켰다.
- 데이터베이스 확장 3라운드 후, GNN-DSE는 최적의 초깃설계 대비 평균 1.8배의 성능 향상을 달성했으며, 모든 커널에서 베이스라인 성능을 향상하거나 유지했다.
- 2mm 커널의 경우, 60분 내로 49200만 개의 설계 포인트 중 78,676개를 탐색했으며, 21시간 탐색 후 AutoDSE와 비교해 0.98배의 성능 향상을 달성했다.
- 미사용 커널(gesummv, bicg, 2mm)에 대해 GNN-DSE는 AutoDSE와 거의 동일한 성능을 달성했으며, 각각 18배, 26배, 350배의 성능 향상을 기록했다. 이는 강력한 일반화 능력을 보여준다.
- bicg 커널의 경우, GNN-DSE는 1.05배의 성능 향상을 기록했으며, AutoDSE의 1.05배 성능 향상보다 뛰어나, 설계공간을 완전히 탐색함으로써 GNN-DSE의 DSE 효율성이 뛰어나다는 것을 입증했다.
- 단지 몇 개의 훈련 예제만으로도 새로운 커널에 대해 효과적으로 일반화된 모델을 제공함으로써, 전이 학습이 새로운 응용 프로그램에 대한 비용이 많이 드는 HLS 평가의 필요성을 크게 줄임을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.