[논문 리뷰] Marvel: A Data-centric Compiler for DNN Operators on Spatial Accelerators
Marvel는 공간 가속기에서 최적의 매핑을 효율적이고 확장 가능하게 검색할 수 있도록 DNN 연산자를 공식적으로 특성화하는 데 사용하는 Maestro Data-Centric(MDC) 표기법을 사용하는 데이터 중심 컴파일러이다. 매핑 공간을 외부 메모리 및 내부 메모리 하위공간으로 분해하고 MDC의 분석 가능한 비용 모델을 활용함으로써, Marvel는 검색 공간을 최대 $O(10^{10})$만큼 줄이며, 이전 최고 수준의 매핑 도구에 비해 10.25배의 기하평균 처리량 향상과 2.01배의 낮은 에너지 소비를 달성한다.
The efficiency of a spatial DNN accelerator depends heavily on the compiler and its cost model ability to generate optimized mappings for various operators of DNN models on to the accelerator's compute and memory resources. But, existing cost models lack a formal boundary over the operators for precise and tractable analysis, which poses adaptability challenges for new DNN operators. To address this challenge, we leverage the recently introduced Maestro Data-Centric (MDC) notation. We develop a formal understanding of DNN operators whose mappings can be described in the MDC notation, because any mapping adhering to the notation is always analyzable by the MDC's cost model. Furthermore, we introduce a transformation for translating mappings into the MDC notation for exploring the mapping space. Searching for the optimal mappings is challenging because of the large space of mappings, and this challenge gets exacerbated with new operators and diverse accelerator configurations.To address this challenge, we propose a decoupled off-chip/on-chip approach that decomposes the mapping space into off-chip and on-chip subspaces, and first optimizes the off-chip subspace followed by the on-chip subspace. The motivation for this decomposition is to reduce the size of the search space dramatically and also to prioritize the optimization of off-chip data movement, which is 2-3 orders of magnitude more compared to the on-chip data movement. We implemented our approach in a tool called {\em Marvel}, and another major benefit of our approach is that it is applicable to any DNN operator conformable with the MDC notation.
연구 동기 및 목표
- 기존 DNN 연산자 매핑을 위한 비용 모델이 공식적인 경계를 갖추지 못해 새로운 연산자 및 가속기 구성에 대한 적응성이 제한되는 문제를 해결하기 위해.
- Maestro Data-Centric(MDC) 표기법으로 표현 가능한 DNN 연산자의 공식적 특성화를 개발하여 정확하고 분석 가능한 분석이 가능하도록 하기 위해.
- 루프 네스트 기반의 연산자 매핑을 MDC 표기법으로 변환하는 변환 기법을 제안하여 매핑 공간의 광범위한 탐색을 가능하게 하기 위해.
- 외부 메모리 및 내부 메모리 최적화를 분리하여 검색 공간을 크게 줄이면서도 고비용 외부 메모리 이동을 우선순위로 고려하는 전략을 제안하기 위해.
- MDC 표기법을 준수하는 모든 DNN 연산자에 대해 일반적으로 적용 가능한 컴파일러 도구 Marvel을 구현하여 높은 성능과 에너지 효율성을 확보하기 위해.
제안 방법
- 논문은 MDC 표기법과 호환되는 DNN 연산자를 식별하기 위한 공식적인 규칙 세트를 제안하여, MDC 비용 모델을 통한 분석 가능성을 보장한다.
- 루프 네스트 기반의 연산자 매핑 표현을 MDC 표기법으로 변환하는 새로운 변환 기법을 제안하여, 복잡한 데이터 레이아웃 및 스케줄링 전략의 체계적 탐색을 가능하게 한다.
- 매핑 공간을 외부 메모리 및 내부 메모리 하위공간으로 분해하고, 외부 메모리 이동 비용을 우선적으로 최적화하여, 내부 메모리 이동보다 2~3개 주기만큼 더 비싼 비용을 감소시킨다.
- 외부 메모리 하위공간은 MDC 표기법 기반의 비용 모델을 사용하여 데이터 이동 및 재사용 패턴을 정확하게 추정한다.
- 내부 메모리 하위공간은 동일한 MDC 비용 모델을 기반으로 하여 처리 요소(PE) 어레이의 활용도를 극대화하고 유휴 사이클을 최소화하는 데 중점을 둔다.
- 전체 파이프라인은 MDC 기반 비용 모델, 변환 엔진, 분리된 검색 전략을 통합한 도구인 Marvel에 구현되어 종단 간 최적화를 수행한다.
실험 결과
연구 질문
- RQ1어떤 DNN 연산자가 Maestro Data-Centric(MDC) 표기법을 사용하여 공식적으로 특성화되고 분석 가능하며, 이러한 연산자의 정의적인 구조적 특성은 무엇인가?
- RQ2루프 네스트 기반의 연산자 매핑은 어떻게 체계적으로 MDC 표기법으로 변환되어 공식적 분석 및 최적화가 가능하게 되는가?
- RQ3외부 메모리 및 내부 메모리 최적화를 분리함으로써 공간 가속기에서 DNN 연산자 매핑에 대한 효과적 검색 공간은 얼마나 줄어들 수 있는가?
- RQ4제안된 MDC 기반의 분리된 최적화 전략은 다양한 DNN 워크로드에서 기존 최고 수준의 매핑 도구에 비해 처리량과 에너지 효율성 측면에서 뛰어나게 성능을 발휘할 수 있는가?
- RQ5이 접근법은 GEMM, LSTM, MLP와 같은 비컨볼루션 연산자로까지 일반화 가능한가? 그리고 어떤 성능 향상이 달성될 수 있는가?
주요 결과
- Marvel는 네 가지 주요 CNN 모델(AlexNet, VGG16, ResNet50, MobileNetV2)에 대해 검색 공간을 약 $10^{10}$배 줄였으며, $9.4 \times 10^{18}$에서 $2.1 \times 10^8$로 감소시켰다.
- Marvel는 이전 연구에서 제안한 세 가지 최고 수준의 매핑 스타일에 비해 기하평균 처리량을 10.25배 향상시키고 에너지 소비를 2.01배 감소시켰다.
- GEMM, LSTM, MLP 워크로드에 대해 Marvel가 생성한 매핑은 dMazeRunner 유사 최적화 도구의 결과보다 4.46배 빠르고, Interstellar 유사 최적화 도구의 결과보다 1.22배 빠르게 작동했다.
- 외부 메모리/내부 메모리 분리 최적화 전략은 외부 메모리 이동 최적화를 우선시함으로써 검색 공간을 크게 줄였으며, 이는 에너지 소비와 지연 시간 비용을 주로 차지하기 때문이다.
- MDC 표기법은 정확한 비용 모델링을 가능하게 하여 컴파일러가 히우리스틱 또는 샘플링 기반 검색 전략에 의존하지 않고 데이터 재사용 및 이동을 추론할 수 있도록 했다.
- Marvel는 비컨볼루션 연산자 포함 다양한 워크로드에서 일관된 성능 향상을 보이며, MDC 표기법을 준수하는 모든 DNN 연산자에 대해 일반적으로 적용 가능한 것을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.