Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic-OFA: Runtime DNN Architecture Switching for Performance Scaling on Heterogeneous Embedded Platforms

Wei Lou, Xun Lei|arXiv (Cornell University)|2021. 05. 08.
Advanced Neural Network Applications참고 문헌 24인용 수 4
한 줄 요약

Dynamic-OFA는 사전 훈련된 Once-for-All (OFA) 슈퍼넷을 활용하여 런타임 시 재훈련 없이 최적의 하위 네트워크를 동적으로 선택함으로써 이질적인 임베디드 플랫폼에서 실시간 DNN 아키텍처 전환을 가능하게 한다. 이는 유사한 정확도에서 최대 CPU 기준 3.5배 빠른 추론(3.5x)과 GPU 기준 2.4배 빠른 추론(2.4x)을 달성하거나, 유사한 지연 시간에서 CPU 기준 3.8% 향상된 정확도(3.8%)와 GPU 기준 5.1% 향상된 정확도(5.1%)를 제공한다. Jetson Xavier NX에서 성능을 입증함.

ABSTRACT

Mobile and embedded platforms are increasingly required to efficiently execute computationally demanding DNNs across heterogeneous processing elements. At runtime, the available hardware resources to DNNs can vary considerably due to other concurrently running applications. The performance requirements of the applications could also change under different scenarios. To achieve the desired performance, dynamic DNNs have been proposed in which the number of channels/layers can be scaled in real time to meet different requirements under varying resource constraints. However, the training process of such dynamic DNNs can be costly, since platform-aware models of different deployment scenarios must be retrained to become dynamic. This paper proposes Dynamic-OFA, a novel dynamic DNN approach for state-of-the-art platform-aware NAS models (i.e. Once-for-all network (OFA)). Dynamic-OFA pre-samples a family of sub-networks from a static OFA backbone model, and contains a runtime manager to choose different sub-networks under different runtime environments. As such, Dynamic-OFA does not need the traditional dynamic DNN training pipeline. Compared to the state-of-the-art, our experimental results using ImageNet on a Jetson Xavier NX show that the approach is up to 3.5x (CPU), 2.4x (GPU) faster for similar ImageNet Top-1 accuracy, or 3.8% (CPU), 5.1% (GPU) higher accuracy at similar latency.

연구 동기 및 목표

  • 변동하는 하드웨어 자원과 애플리케이션 워크로드로 인한 이질적인 임베디드 플랫폼에서 DNN 추론의 동적 성능 저하 문제를 해결한다.
  • 각 배포 환경에 맞게 재훈련이 필요한 전통적인 동적 DNN의 높은 훈련 비용 문제를 해결한다.
  • 단일 공유 백본 모델을 사용하여 CPU, GPU, NPU 등 다양한 컴퓨팅 유닛 간 효율적인 런타임 적응을 가능하게 한다.
  • 현재 하드웨어 가용성과 애플리케이션 제약 조건을 기반으로 최적의 하위 네트워크를 선택하여 실시간 정확도-지연 시간 트레이드오���场合을 향상시킨다.
  • 사전 샘플링 및 사전 평가를 통해 OFA 슈퍼넷에서 하위 네트워크를 오프라인으로 준비함으로써 재훈련이 필요 없도록 한다.

제안 방법

  • 폭넓은 넓이, 깊이, 필터 크기, 입력 해상도의 변형을 포함한 사전 훈련된 Once-for-All (OFA) 슈퍼넷에서 하위 네트워크의 패밀리를 사전 샘플링한다.
  • 오프라인으로 CPU 및 GPU에서 모든 하위 네트워크를 평가하여 정확도-지연 시간 트레이드오프의 파레토 최적 룩업 테이블을 구축한다.
  • 빠른 추론과 하위 네트워크 전환을 가능하게 하기 위해 사전 계산된 배치 정규화 통계를 저장한다.
  • 런타임 관리자(RTM)를 구현하여 50개의 추론에 대한 슬라이딩 윈도우를 활용해 실시간 지연 시간과 정확도 제약 조건을 모니터링한다.
  • 가용한 하드웨어 자원과 애플리케이션 요구 사항에 따라 런타임 중 하위 네트워크를 동적으로 전환하여 전환 오버헤드를 최소화한다.
  • 동일한 GPU에서 여러 Dynamic-OFA 모델이 공존할 수 있도록 하며, 개별 지연 시간 제약 조건을 충족시키기 위해 하위 네트워크를 공동으로 적응시킨다.

실험 결과

연구 질문

  • RQ1사전 훈련된 OFA 슈퍼넷을 활용하여 추가 훈련 없이 동적 DNN 아키텍처 전환을 가능하게 할 수 있는가?
  • RQ2Dynamic-OFA는 이질적인 SoC에서 가변하는 하드웨어 자원 가용성에 적응하면서도 높은 정확도를 유지하는 데 얼마나 효과적인가?
  • RQ3Dynamic-OFA는 CPU 및 GPU 워크로드에서 최신 기술 대비 더 나은 정확도-지연 시간 트레이드오프를 달성할 수 있는가?
  • RQ4동일한 GPU를 공유하는 여러 DNN 또는 동시 워크로드가 존재할 경우 Dynamic-OFA는 성능 제약 조건을 어떻게 관리하는가?
  • RQ5하위 네트워크 전환의 런타임 오버헤드는 얼마이며, 실시간 반응성에 어떤 영향을 미치는가?

주요 결과

  • 유사한 ImageNet Top-1 정확도에서 Dynamic-OFA는 최대 CPU 기준 3.5배 빠른 추론(3.5x)과 GPU 기준 2.4배 빠른 추론(2.4x)을 달성한다.
  • 유사한 지연 시간에서 Dynamic-OFA는 CPU 기준 3.8% 높은 Top-1 정확도(3.8%)와 GPU 기준 5.1% 높은 정확도(5.1%)를 제공한다.
  • 런타임 관리자가 변화하는 지연 시간 제약 조건에 대응하여 하위 네트워크를 적응시키며, GPU에서 더 엄격한 40ms 목표를 충족하기 위해 레벨 6에서 레벨 2로 전환하였다.
  • GPU 자원이 동시 학습 작업과 공유될 경우, Dynamic-OFA는 하위 네트워크 레벨을 4에서 2로 낮춰 정확도를 2.6% 포기함으로써 지연 시간 제약 조건을 충족시켰다.
  • 동일한 GPU에서 두 개의 Dynamic-OFA 모델이 공존할 경우, 개별 지연 시간 제약 조건을 충족시키기 위해 하위 네트워크를 공동으로 적응시켰으며, 모델 A는 레벨 6에서 5로, 모델 B는 레벨 5에서 4로 전환하였다.
  • 런타임 관리자는 전환당 약 ~15ms의 오버헤드만을 유발하며, 반응 시간은 1~2초(약 50개의 추론)이므로 실세계 배포에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.