[논문 리뷰] SoC-Tuner: An Importance-guided Exploration Framework for DNN-targeting SoC Design
SoC-Tuner는 DNN 최적화 시스템온칩(SoC) 아키텍처 설계를 위한 새로운 중요도 기반 탐색 프레임워크이다. 중요도 기반 프루닝, 대표 샘플링, 정보 기반 다목적 최적화 및 전체 VLSI 플로우 평가를 통해 효율적으로 파레토 최적 SoC 구성(configuration)를 식별하며, DNN 벤치마크에서 이전 방법들보다 정확도와 수렴 속도에서 뛰어나다.
Designing a system-on-chip (SoC) for deep neural network (DNN) acceleration requires balancing multiple metrics such as latency, power, and area. However, most existing methods ignore the interactions among different SoC components and rely on inaccurate and error-prone evaluation tools, leading to inferior SoC design. In this paper, we present SoC-Tuner, a DNN-targeting exploration framework to find the Pareto optimal set of SoC configurations efficiently. Our framework constructs a thorough SoC design space of all components and divides the exploration into three phases. We propose an importance-based analysis to prune the design space, a sampling algorithm to select the most representative initialization points, and an information-guided multi-objective optimization method to balance multiple design metrics of SoC design. We validate our framework with the actual very-large-scale-integration (VLSI) flow on various DNN benchmarks and show that it outperforms previous methods. To the best of our knowledge, this is the first work to construct an exploration framework of SoCs for DNN acceleration.
연구 동기 및 목표
- 간단한 분석 모델에 의존함으로써 DNN 타겟 SoC 설계에서 정확하고 완전한 설계 공간 탐색이 어려운 문제를 해결하기 위해.
- 고품질 구성(configuration)의 자동 식별을 통해 SoC 탐색에 소요되는 시간과 전문 지식을 줄이기 위해.
- CPU, 가속기, 메모리, 인터커넥트를 포함한 모든 주요 SoC 구성요소 간의 상호작용을 포함하는 종합적인 설계 공간을 구축하기 위해.
- 분석 모델의 근사치를 대체하여 전체 VLSI 플로우를 사용해 지연, 전력, 면적에 대한 정확한 하드웨어 수준 평가를 수행하기 위해.
- 다양한 설계 지표 간의 파레토 최적 트레이드오프 공간에 대한 자동화되고 편향 없는 탐색을 가능하게 하기 위해.
제안 방법
- CPU, 가속기(예: 시스톨릭 어레이), 메모리 계층, 인터커넥트를 포함한 모든 주요 SoC 구성요소를 파arameter화하여 종합적인 설계 공간을 구성한다.
- ICD 알고리즘을 사용한 중요도 기반 분석을 적용하여 영향력이 낮은 설계 파라미터를 식별하고 제거함으로써 설계 공간을 30.16% 감소시킨다.
- 최적화를 위한 대표적인 초기화 지점들을 선택하기 위해 샘플링 알고리즘을 활용하여 다양하고 정보가 풍부한 초기 구성(configuration)을 보장한다.
- 기대 하이퍼볼륨 개선도를 사용해 지연, 전력, 면적 간 균형을 맞추는 정보 기반 다목적 최적화 전략을 활용한다.
- 정확한 설계 지점 평가를 위해 분석 모델 대신 전체 VLSI 플로우를 활용한다.
- 빠른 파arameterized 하드웨어 생성 및 RTL 시뮬레이션을 위해 Chipyard와 Chisel에 통합한다.
실험 결과
연구 질문
- RQ1어떻게 DNN 타겟 SoC의 설계 공간을 효과적으로 줄일 수 있으며, 同시에 파레토 최적 구성(configuration)을 찾을 수 있는 능력을 유지할 수 있는가?
- RQ2전체 VLSI 플로우 평가를 사용할 경우 분석 모델 대비 설계 공간 탐색의 정확도가 얼마나 향상되는가?
- RQ3중요도 기반 프루닝과 대표 샘플링이 다목적 SoC 탐색에서 파레토 최적 집합으로의 수렴 속도를 상당히 가속화할 수 있는가?
- RQ4SoC-Tuner의 최적화 전략은 최신 기술 수준의 방법들과 비교해 수렴 속도와 진짜 파레토 프론트에 가까운 정도에서 어떻게 비교되는가?
- RQ5이 프레임워크는 다양한 DNN 워크로드에 일반화될 수 있으며, 높은 효율성과 정확도를 유지할 수 있는가?
주요 결과
- SoC-Tuner는 ICD 알고리즘을 사용한 중요도 기반 프루닝으로 설계 공간을 30.16% 감소시켜 탐색 효율성을 크게 향상시켰다.
- 기준 파레토 집합에 대한 평균 거리(ADRS)가 베이스라인 방법들보다 낮아, 진짜 파레토 프론트로의 수렴성이 뛰어나다는 것을 입증했다.
- 지연-면적 및 지연-전력 공간에서 SoC-Tuner의 학습된 파레토 집합은 다른 방법들보다 실제 파레토 최적 집합에 훨씬 가까운 것으로 나타났다(그림 4 참조).
- 이전 연구에서 사용된 단순화된 분석 모델은 VLSI 플로우를 통해 확보한 실제 지표와 상당한 차이를 보이며, 이는 그 정확도가 떨어진다는 것을 증명한다.
- SoC-Tuner는 ResNet50 및 트랜스포머 기반 모델을 포함한 여러 DNN에서 가장 낮은 추론 사이클 수를 달성하여 다른 탐색 방법들을 능가했다.
- SoC-Tuner가 생성한 최적 SoC 설계는 최소한의 면적 오버헤드로 가장 높은 성능을 달성했으며, 그 결과는 그림 7(b)의 VLSI 면적 분석을 통해 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.