[논문 리뷰] Reinforcement Learning and Adaptive Sampling for Optimized DNN Compilation
이 논문은 깊이 신경망(DNN)을 위한 강화학습(RL)-기반 최적화 컴파일러인 ReLeASE를 제안한다. 이는 군집 기반 적응형 샘플링을 통합하여 비용이 많이 드는 하드웨어 측정을 줄인다. DNN 컴파일링을 RL 문제로 공식화하고, 대표성 있는 부분공간에 샘플을 집중함으로써 ReLeASE는 AutoTVM보다 최적화 시간을 4.45배 빠르게 하고, 추론 성능을 최대 5.6% 향상시켰으며, 검색 단계와 측정 오버헤드가 크게 감소했다.
Achieving faster execution with shorter compilation time can enable further diversity and innovation in neural networks. However, the current paradigm of executing neural networks either relies on hand-optimized libraries, traditional compilation heuristics, or very recently, simulated annealing and genetic algorithms. Our work takes a unique approach by formulating compiler optimizations for neural networks as a reinforcement learning problem, whose solution takes fewer steps to converge. This solution, dubbed ReLeASE, comes with a sampling algorithm that leverages clustering to focus the costly samples (real hardware measurements) on representative points, subsuming an entire subspace. Our adaptive sampling not only reduces the number of samples, but also improves the quality of samples for better exploration in shorter time. As such, experimentation with real hardware shows that reinforcement learning with adaptive sampling provides 4.45x speed up in optimization time over AutoTVM, while also improving inference time of the modern deep networks by 5.6%. Further experiments also confirm that our adaptive sampling can even improve AutoTVM's simulated annealing by 4.00x.
연구 동기 및 목표
- 현재 시뮬레이티드 어닐링과 유전자 알고리즘과 같은 히우리스틱 또는 확률적 방법에 의존하는 DNN 컴파일링 최적화의 시간과 비용을 줄이기 위해.
- 검색 과정에서 실제 하드웨어 측정의 높은 계산 비용을 줄이기 위해 필요한 샘플 수를 최소화하기 위해.
- 전통적인 검색 전략 대신 강화학습을 활용하여 DNN 컴파일러 최적화의 검색 효율성과 해의 품질을 향상시키기 위해.
- 군집 기반 부분공간 집중을 통해 측정 수를 줄이면서도 높은 대표성과 관련성을 유지하는 샘플링 전략을 개발하기 위해.
제안 방법
- 강화학습(RL) 문제로 DNN 컴파일링을 공식화하여, 에이전트가 성능을 최대화하기 위해 최적의 컴파일러 파라미터(노브)를 선택하도록 학습한다.
- 검색 공간을 군집화하여 대표성 있는 부분공간을 식별하고, 이러한 지점에서 하드웨어 측정을 우선순위화하는 적응형 샘플링 알고리즘을 도입한다.
- 군집을 통해 전체 부분공간을 대체함으로써, 비용이 많이 드는 실제 하드웨어 측정 수를 줄이면서도 탐색 품질을 유지한다.
- 측정된 추론 시간을 기반으로 보상 함수를 사용하여 RL 에이전트가 더 빠른 최적화 코드로 향하도록 이끈다.
- 비용 모델을 사용하여 검색 공간의 고정보 영역에 집중함으로써 중복 측정를 방지하고, RL 정책 학습과 결합한다.
- TVision 및 기타 DNN 프레임워크와 호환되는 오픈소스 최적화 컴파일러인 ReLeASE로 프레임워크를 구현한다.
실험 결과
연구 질문
- RQ1강화학습은 시뮬레이티드 어닐링과 유전자 알고리즘과 같은 전통적인 확률적 최적화 방법보다 DNN 컴파일러 최적화에서 더 우수한 성능을 낼 수 있는가?
- RQ2군집 기반 적응형 샘플링은 해의 품질을 훼손하지 않고 필요한 하드웨어 측정 수를 줄일 수 있는가?
- RQ3RL과 적응형 샘플링을 결합하면 실제 DNN에서 수렴 속도가 빨라지고 더 최적화된 코드가 도출되는가?
- RQ4기존에 비용 모델을 사용하는 AutoTVM와 같은 기존 프레임워크에 대해 적응형 샘플링은 어느 정도 향상 효과를 낼 수 있는가?
주요 결과
- ReLeASE는 ResNet-18에서 AutoTVM 대비 최적화 시간을 4.45배 단축시켰으며, 1.20시간 대비 9.13시간을 기록했다.
- AlexNet, VGG-16, ResNet-18 전반에서 추론 성능을 최대 5.6% 향상시켰으며, 종합 추론 시간은 1.0277ms에서 0.9673ms로 감소했다.
- 적응형 샘플링은 AutoTVM의 시뮬레이티드 어닐링 최적화 시간을 4.00배 단축시켜 일반화 가능성도 입증했다.
- RL 기반 접근법은 시뮬레이티드 어닐링보다 더 적은 단계 내에서 수렴했으며, 더 나은 또는 동등한 성능을 더 적은 검색 노력으로 달성했다.
- 적응형 샘플링 알고리즘은 군집화된 대표 부분공간에 집중함으로써 하드웨어 측정 수를 줄여 샘플 효율성을 향상시켰다.
- ReLeASE는 오픈소스로 공개되어 기존 DNN 컴파일링 파이프라인에 통합 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.