[논문 리뷰] A Graph Deep Learning Framework for High-Level Synthesis Design Space Exploration
이 논문은 C/C++ 행동 기술서를 하이브리드 제어 및 데이터 흐름 그래프로 모델링함으로써 고수준 합성(HLS) 설계 공간 탐색(DSE)에서 성능과 하드웨어 비용을 예측하는 그래프 신경망(GNN) 프레임워크 gnn4hls를 제안한다. 이는 기존의 DSE 방법보다 빠르고 정확한 파레토 최적 구성 탐색을 가능하게 하며, 시뮬레이터 수준의 정확도를 1000배 빠르게 달성하고, 미세조정을 통해 새로운 애플리케이션으로의 강력한 전이성을 확보한다.
The design of efficient hardware accelerators for high-throughput data-processing applications, e.g., deep neural networks, is a challenging task in computer architecture design. In this regard, High-Level Synthesis (HLS) emerges as a solution for fast prototyping application-specific hardware starting from a behavioural description of the application computational flow. This Design-Space Exploration (DSE) aims at identifying Pareto optimal synthesis configurations whose exhaustive search is often unfeasible due to the design-space dimensionality and the prohibitive computational cost of the synthesis process. Within this framework, we effectively and efficiently address the design problem by proposing, for the first time in the literature, graph neural networks that jointly predict acceleration performance and hardware costs of a synthesized behavioral specification given optimization directives. The learned model can be used to rapidly approach the Pareto curve by guiding the DSE, taking into account performance and cost estimates. The proposed method outperforms traditional HLS-driven DSE approaches, by accounting for arbitrary length of computer programs and the invariant properties of the input. We propose a novel hybrid control and data flow graph representation that enables training the graph neural network on specifications of different hardware accelerators; the methodology naturally transfers to unseen data-processing applications too. Moreover, we show that our approach achieves prediction accuracy comparable with that of commonly used simulators without having access to analytical models of the HLS compiler and the target FPGA, while being orders of magnitude faster. Finally, the learned representation can be exploited for DSE in unexplored configuration spaces by fine-tuning on a small number of samples from the new target domain.
연구 동기 및 목표
- 하드웨어 가속기의 고차원적이고 계산 비용이 큰 HLS 설계 공간 탐색(DSE) 문제를 해결한다.
- 비용이 많이 드는 시뮬레이션을 대체하여 학습된 성능 및 비용 예측으로 전합 합성 실행에 대한 의존도를 줄인다.
- 최소한의 재학습을 통해 미세조정을 활용해 새로운, 알려지지 않은 애플리케이션으로의 전이 학습을 가능하게 한다.
- 임의의 길이의 프로그램을 지원하고 프로그램 인variant를 유지하는 일반화 가능한 아키텍처에 종속되지 않는 프레임워크를 개발한다.
- 기계 학습과 EDA 사이의 격차를 메우기 위해 인간의 간섭 없이 데이터 기반 자동 DSE를 가능하게 한다.
제안 방법
- 구조적 및 의미적 프로그램 성질을 모두 포착하기 위해 C/C++ 행동 기술서를 하이브리드 제어 및 데이터 흐름 그래프로 표현한다.
- 그래프 표현에서 성능(예: 지연 시간)과 하드웨어 비용(예: LUTs, BRAMs)을 동시에 예측하는 새로운 그래프 신경망(GNN) 아키텍처를 설계한다.
- 다양한 애플리케이션에서 다수의 HLS 설정에 대해 GNN을 학습시켜 최적화 행동의 이전 가능한 표현을 학습한다.
- 프로그램 인variant를 유지하고 다양한 프로그램 구조 및 길이에 걸쳐 일반화를 지원하는 하이브리드 그래프 표현을 사용한다.
- 소량의 새로운 애플리케이션 샘플에 대한 미세조정을 통해 도메인 적응을 가능하게 하여 최소한의 데이터로 높은 성능을 달성한다.
- GNN의 인덕티브 바이어스를 활용해 학습 데이터를 초월한 일반화를 가능하게 하며, 새로운 워크로드에 대해 제로샷 또는 희소샷 DSE를 지원한다.
실험 결과
연구 질문
- RQ1분석적 컴파일러 모델이나 FPGA 대상 세부 정보에 접근하지 못하는 상황에서 그래프 신경망이 HLS DSE에서 성능과 하드웨어 비용을 효과적으로 예측할 수 있는가?
- RQ2기존의 전이 학습 또는 모델 기반 DSE 접근 방식과 비교해 제안된 GNN 프레임워크가 알려지지 않은 애플리케이션과 설계 공간으로의 일반화 능력은 어느 정도인가?
- RQ3비용이 많이 드는 합성 실행을 얼마나 효과적으로 대체할 수 있으며, 전체 시뮬레이션 수준의 정확도를 유지할 수 있는가?
- RQ4특히 딥러닝과 같은 계산이 집약적인 분야에서, 모델의 성능은 다양한 애플리케이션 유형 간에 어떻게 변동하는가?
- RQ5최소한의 데이터로 학습된 GNN 표현을 효과적으로 새로운 타겟 도메인에 대해 미세조정할 수 있는가? 이는 새로운 설계 환경에서의 빠른 구현을 가능하게 하는가?
주요 결과
- gnn4hls 프레임워크는 전체 사이클 HLS 시뮬레이터 수준의 정확도를 확보하면서도 추론 속도가 최대 1000배 빠르다.
- 선형 대수학 커널과 같은 딥러닝에 핵심적인 다양한 애플리케이션에 대해 강력한 일반화 능력을 보이며, 최첨단 기준 대비 평균 파레토 경계까지의 거리(ADRS)가 낮다.
- 단지 몇 개의 새로운 애플리케이션 샘플에 대한 미세조정만으로도 높은 성능을 달성하여, 이 프레임워크의 새로운 설계 공간에 대한 적응 가능성과 탄력성을 확인한다.
- 하이브리드 제어 및 데이터 흐름 그래프 표현은 임의의 길이의 프로그램에 대한 효과적인 모델링을 가능하게 하며, 정확한 예측을 위해 필수적인 의미적 인variant를 유지한다.
- 기존의 모델 기반 및 정밀화 기반 DSE 전략보다 수렴 속도와 파레토 경계 근사 능력 측면에서 모두 뛰어난 성능을 보인다.
- 실증 평가 결과, 특히 신경 처리 워크로드에서 예측 성능의 변동성이 낮고 평균 정확도가 높은 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.