[논문 리뷰] CoSA: Scheduling by Constrained Optimization for Spatial Accelerators
CoSA는 혼합정수계획법 문제로 DNN 가속기 스케줄링을 공식화하는 제약 최적화 프레임워크로, 한 번의 결정적 해결을 통해 타일링, 루프 순서 정렬, 공간 매핑을 종합 최적화한다. 반복적 탐색을 제거함으로써 최신 스케줄러 대비 최대 2.5배의 성능 향상과 90배 빠른 솔루션 도달 시간을 달성하며, 고성능의 일괄 스케줄링을 위해 알고리즘적 및 아키텍처적 규칙성을 활용한다.
Recent advances in Deep Neural Networks (DNNs) have led to active development of specialized DNN accelerators, many of which feature a large number of processing elements laid out spatially, together with a multi-level memory hierarchy and flexible interconnect. While DNN accelerators can take advantage of data reuse and achieve high peak throughput, they also expose a large number of runtime parameters to the programmers who need to explicitly manage how computation is scheduled both spatially and temporally. In fact, different scheduling choices can lead to wide variations in performance and efficiency, motivating the need for a fast and efficient search strategy to navigate the vast scheduling space. To address this challenge, we present CoSA, a constrained-optimization-based approach for scheduling DNN accelerators. As opposed to existing approaches that either rely on designers' heuristics or iterative methods to navigate the search space, CoSA expresses scheduling decisions as a constrained-optimization problem that can be deterministically solved using mathematical optimization techniques. Specifically, CoSA leverages the regularities in DNN operators and hardware to formulate the DNN scheduling space into a mixed-integer programming (MIP) problem with algorithmic and architectural constraints, which can be solved to automatically generate a highly efficient schedule in one shot. We demonstrate that CoSA-generated schedules significantly outperform state-of-the-art approaches by a geometric mean of up to 2.5x across a wide range of DNN networks while improving the time-to-solution by 90x.
연구 동기 및 목표
- 스페이셜 DNN 가속기에서 고차원이고 광범위한 스케줄링 공간을 탐색하는 과제를 해결하기 위해, 브루트포스나 반복 피드백 기반 방법으로는 비현실적인 문제를 다루기 위해.
- 반복적 탐색이나 대규모 시뮬레이션을 피하기 위해 스케줄링을 결정적 제약 최적화 문제로 공식화함으로써, 비용이 많이 드는 반복적 탐색이 필요 없도록 하기 위해.
- 하드웨어 및 알고리즘적 제약에 기반한 통합 수학적 공식화를 통해 타일링, 루프 순서 정렬, 공간 매핑을 동시에 최적화하기 위해.
- GPU 및 맞춤형 스페이셜 가속기 포함 다양한 DNN 워크로드와 가속기 아키텍처에서 성능 및 에너지 효율성을 향상시키기 위해.
- 재학습이나 광범위한 시뮬레이션 없이도 새로운 또는 변화하는 하드웨어에 대해 빠르고 확장 가능하며 이식 가능한 스케줄링을 가능하게 하기 위해.
제안 방법
- CoSA는 DNN 레이어 차원과 메모리 계층 구조, 네트워크 온 칩(NoC) 구조와 같은 하드웨어 파rameter를 기반으로 한 제약 조건을 포함하는 혼합정수계획법(MIP) 문제로 DNN 스케줄링을 공식화한다.
- 메모리 계층 간 타일 크기, 데이터 재사용을 위한 루프 순서 정렬, 처리 요소에 대한 계산의 공간 매핑을 MIP 공식화의 결정 변수로 모델링한다.
- 공유 메모리 제한, 레지스터 사용량, GPU의 스레드 블록 크기 제한과 같은 아키텍처 제약 조건을 통합하여, 유효한 스케줄만 생성되도록 보장한다.
- 온칩 메모리와 NoC 간 데이터 이동 비용을 명시적으로 모델링하는 커뮤니케이션 중심의 목적 함수를 사용하여, 커뮤니케이션 오버헤드를 줄인다.
- 목적 함수는 계산 활용도, 메모리 재사용, 커뮤니케이션 비용을 조합하며, 무게를 마이크로 벤치마크를 통해 조정하여 상호 간의 트레이드오프를 균형 잡는다.
- 표준 수학 최적화 솔버를 사용해 MIP 문제를 한 번의 스캔으로 해결함으로써, 반복적 탐색이나 강화 학습을 피한다.
실험 결과
연구 질문
- RQ1DNN 가속기 스케줄링을 반복적 탐색이나 고비용 학습이 필요 없는 단일 결정적 제약 최적화 문제로 공식화할 수 있는가?
- RQ2통합 MIP 공식화가 다양한 DNN 워크로드에서 타일링, 루프 순서 정렬, 공간 매핑을 동시에 최적화하는 데 얼마나 효과적인가?
- RQ3다양한 하드웨어 플랫폼에서 CoSA는 성능, 에너지 효율성, 솔루션 도달 시간 측면에서 최신 스케줄러를 얼마나 뛰어나게 성능을 내는가?
- RQ4재학습이나 시뮬레이션 없이도 CoSA는 새로운 또는 변화하는 가속기 아키텍처에 얼마나 잘 일반화되는가?
- RQ5CoSA에서 네트워크 트래픽 비용을 고려한 커뮤니케이션 인식 목적 함수는 네트워크 트래픽 비용을 忽시하는 모델보다 더 나은 성능을 내는가?
주요 결과
- CoSA가 생성한 스케줄은 Timeloop Hybrid 및 Random search와 같은 최신 스케줄러 대비 여러 DNN 네트워크에서 기하평균 최대 2.5배의 성능 향상을 달성한다.
- CoSA의 솔루션 도달 시간은 반복적 방법 대비 90배 빠르며, 평균 각 레이어당 0.02초의 일괄 솔루션을 제공한다.
- NoC 시뮬레이터에서 CoSA는 최고의 Random search 솔루션 대비 최대 3.3배, Timeloop Hybrid 대비 2.5배의 성능 향상을 기록했으며, 특히 커뮤니케이션 비용이 높은 컨볼루션 레이어에서 뛰어난 성능을 보였다.
- K80 GPU에서 CoSA가 생성한 스케줄은 XGBoost 투너를 사용한 TVM 대비 기하평균 1.10배의 성능 향상을 달성했으며, 솔루션 도달 시간은 2,500배 빨라져 레이어당 0.02초 대비 50초를 기록했다.
- 기본 스케줄러 대비 에너지 효율성을 22% 향상시켜 계산 및 커뮤니케이션 오버헤드를 동시에 줄이는 데 효과적임을 입증했다.
- 메모리 제약 레이어에서도 성능 저하 없이, ResNet-50, DeepBench, 완전 연결 레이어를 포함한 다양한 워크로드에서 일관되게 고품질 스케줄을 생성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.