Skip to main content
QUICK REVIEW

[논문 리뷰] Accuracy vs. Efficiency: Achieving Both through FPGA-Implementation Aware Neural Architecture Search

Weiwen Jiang, Xinyi Zhang|arXiv (Cornell University)|2019. 01. 31.
Advanced Neural Network Applications참고 문헌 14인용 수 7
한 줄 요약

이 논문은 정확도와 지연 시간을 동시에 최적화하는 하드웨어 인지 신경망 아키텍처 탐색 프레임워크인 FNAS를 제안한다. 타일 기반 추상화 모델과 새로운 다중 FPGA 스케줄링 파라다임을 사용하여 FNAS는 빠른 지연 시간 추정과 위반되는 아키텍처의 조기 정제를 가능하게 하여 최대 11.13배 빠른 검색을 달성하고, 최신 기술 대비 정확도 손실이 1% 미만으로 엄격한 타이밍 사양을 충족한다.

ABSTRACT

A fundamental question lies in almost every application of deep neural networks: what is the optimal neural architecture given a specific dataset? Recently, several Neural Architecture Search (NAS) frameworks have been developed that use reinforcement learning and evolutionary algorithm to search for the solution. However, most of them take a long time to find the optimal architecture due to the huge search space and the lengthy training process needed to evaluate each candidate. In addition, most of them aim at accuracy only and do not take into consideration the hardware that will be used to implement the architecture. This will potentially lead to excessive latencies beyond specifications, rendering the resulting architectures useless. To address both issues, in this paper we use Field Programmable Gate Arrays (FPGAs) as a vehicle to present a novel hardware-aware NAS framework, namely FNAS, which will provide an optimal neural architecture with latency guaranteed to meet the specification. In addition, with a performance abstraction model to analyze the latency of neural architectures without training, our framework can quickly prune architectures that do not satisfy the specification, leading to higher efficiency. Experimental results on common data set such as ImageNet show that in the cases where the state-of-the-art generates architectures with latencies 7.81x longer than the specification, those from FNAS can meet the specs with less than 1% accuracy loss. Moreover, FNAS also achieves up to 11.13x speedup for the search process. To the best of the authors' knowledge, this is the very first hardware aware NAS.

연구 동기 및 목표

  • 기존 신경망 아키텍처 탐색(NAS) 프레임워크의 비효율성과 하드웨어 인식 부족 문제를 해결하기 위해.
  • 정확도를 희생시키지 않고 특정 FPGA 지연 시간 제약 조건을 충족하는 DNN 아키텍처를 생성할 수 있도록 NAS를 가능하게 하기 위해.
  • 타이밍 사양을 위반하는 아키텍처를 프로세스 초기 단계에서 조기에 제거하여 검색 시간을 단축하기 위해.
  • 다중 FPGA 시스템에서 비정규적이고 복잡한 DNN 아키텍처에 대해 정확하고 확장 가능한 지연 시간 추정 모델을 개발하기 위해.
  • 다중 FPGA 간 병렬성을 극대화하여 성능을 향상시키는 데 기여하는 새로운 스케줄링 파라다임을 도입하기 위해.

제안 방법

  • FPGA 매핑을 위한 DNN 아키텍처를 추상화하기 위해 타일 기반 그래프 모델을 제안하여 작업의 세분성, 의존성 및 데이터 액세스 패턴을 포괄한다.
  • 완전한 학습 없이도 지연 시간을 추정할 수 있는 성능 추상화 모델을 도입하여, 위반되는 아키텍처의 조기 정제를 가능하게 한다.
  • 병렬성을 극대화하고 파이프라인 정지 시간을 최소화하기 위해 태스크를 다중 FPGA에 동적으로 스케줄링하는 새로운 다중 FPGA 스케줄링 파라다임을 개발한다.
  • 추상화 모델은 작업 그래프에 추가 엣지를 통해 복잡한 층 간 의존성을 포착하여 정확한 지연 시간 예측을 가능하게 한다.
  • 하드웨어 인식 제약 조건을 검색 프로세스에 직접 통합하여 타당하지 않은 아키텍처는 평가되지 않도록 보장한다.
  • 실행 지연 시간과 파이프라인 정지 시간의 이론적 분 析를 통해 추상화 모델의 지연 시간 추정을 안내한다.

실험 결과

연구 질문

  • RQ1FPGA에서 정확도와 하드웨어 지연 시간을 동시에 최적화할 수 있는 NAS 프레임워크를 설계할 수 있는가?
  • RQ2완전한 학습이나 하드웨어 합성 없이도 비정규적인 DNN 아키텍처의 지연 시간을 정확하게 추정할 수 있는가?
  • RQ3파이프라인 정지 시간과 실행 시간을 최소화하면서 다중 FPGA의 효율적 활용을 가능하게 하는 스케줄링 전략은 무엇인가?
  • RQ4하드웨어 인식 정제는 검색 시간을 얼마나 줄일 수 있으며, 동시에 높은 정확도를 유지할 수 있는가?
  • RQ5하드웨어 인식 NAS 프레임워크는 엄격한 타이밍 제약 조건을 충족하면서 정확도 저하를 최소화할 수 있는가?

주요 결과

  • FNAS는 최신 기술 대비 최대 11.13배 빠른 검색을 달성하며, CIFAR-10에서 가장 높은 속도 향상을 보였다.
  • 타이밍 사양을 위반하는 아키텍처의 경우 NAS는 목표 대비 7.81배 긴 지연 시간을 가지지만, FNAS는 정확도 손실이 1% 미만으로 준수 가능한 아키텍처를 생성했다.
  • ImageNet에서 FNAS는 엄격한 타이밍 제약 조건 하에서도 정확도 저하가 1% 미만으로 유지되어 정확도-효율성의 우수한 트레이드오프를 보였다.
  • 제안된 스케줄러는 고정 스케줄링 대비 다중 FPGA 가속기에서의 클록 사이클 수를 감소시켜 더 나은 하드웨어 활용도를 입증했다.
  • 타이밍 제약 조건이 엄격해질수록 FNAS의 검색 시간이 감소하는 것은 비가능한 아키텍처를 효과적으로 조기에 정제하기 때문이었다.
  • 추상화 모델은 완전한 학습 없이도 정확한 지연 시간 추정을 가능하게 하여 초기 단계의 정제가 가능하고 효율적이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.