Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Co-design of Neural Architectures and Hardware Accelerators

Yanqi Zhou, Xuanyi Dong|arXiv (Cornell University)|2021. 02. 17.
Advanced Neural Network Applications참고 문헌 37인용 수 17
한 줄 요약

이 논문은 산업 표준 엣지 가속기에서 모델 아키텍처와 가속기 구성 요소를 동시에 최적화하는 공동 신경망 아키텍처 및 하드웨어 가속기 탐색 프레임워크인 NAHAS를 제안한다. 하드웨어 제약 조건을 고려해 양쪽 공간을 함께 탐색함으로써, 기존 최고 수준의 방법보다 1% 높은 ImageNet top-1 정확도와 최대 2배 낮은 에너지 소비를 달성한다.

ABSTRACT

Neural architectures and hardware accelerators have been two driving forces for the progress in deep learning. Previous works typically attempt to optimize hardware given a fixed model architecture or model architecture given fixed hardware. And the dominant hardware architecture explored in this prior work is FPGAs. In our work, we target the optimization of hardware and software configurations on an industry-standard edge accelerator. We systematically study the importance and strategies of co-designing neural architectures and hardware accelerators. We make three observations: 1) the software search space has to be customized to fully leverage the targeted hardware architecture, 2) the search for the model architecture and hardware architecture should be done jointly to achieve the best of both worlds, and 3) different use cases lead to very different search outcomes. Our experiments show that the joint search method consistently outperforms previous platform-aware neural architecture search, manually crafted models, and the state-of-the-art EfficientNet on all latency targets by around 1% on ImageNet top-1 accuracy. Our method can reduce energy consumption of an edge accelerator by up to 2x under the same accuracy constraint, when co-adapting the model architecture and hardware accelerator configurations.

연구 동기 및 목표

  • 하드웨어 구성이 고정된 플랫폼 인식 NAS의 한계를 해결하기 위해, 이는 모델 효율성과 성능을 제한하기 때문이다.
  • 에지 디바이스에서 하드웨어 가속기 구성 요소가 신경망 아키텍처 탐색 결과와 모델 효율성에 미치는 영향을 조사하기 위해.
  • 지연, 에너지, 칩 면적 제약 조건 하에서 신경망 아키텍처와 하드웨어 가속기 구성 요소를 동시에 최적화하는 통합 프레임워크를 개발하기 위해.
  • 사용자 정의된 NAS 탐색 공간과 양쪽 공간의 공동 탐색이 순차적 또는 고정 구성 방법보다 더 나은 파레토 최적 해를 도출할 수 있음을 입증하기 위해.
  • 실제 엣지 가속기를 사용하여 이미지 분류 및 세그멘테이션과 같은 다양한 작업에 대해 프레임워크의 일반화 능력을 검증하기 위해.

제안 방법

  • 신경망 아키텍처와 하드웨어 가속기 구성 요소를 동시에 탐색할 수 있는 통합 탐색 공간에서 이중 최적화 프레임워크인 NAHAS를 제안한다.
  • 신경망 아키텍처와 하드웨어 가속기 구성 요소(예: 처리 요소 수, 메모리 대역폭, 계산 대 메모리 비율 등)를 조정 가능한 변수로 파arameter화한다.
  • 실용적 타당성을 확보하기 위해 칩 면적, 추론 지연, 에너지 소비에 하드웨어 자원 제약 조건을 적용한다.
  • 고정된 모델이 아닌 실제 워크로드(예: 이미지 분류, 객체 검출)에 따라 유도되는 작업 중심 접근 방식을 사용한다.
  • 효율성을 위해 파라미터 공유를 활용한 다중 시도 탐색 전략을 도입하여 대규모 탐색 공간의 확장 가능한 탐색을 가능하게 한다.
  • 하드웨어 및 모델 공동 최적화 과정에서 탐색과 제약 조건 이행 간의 균형을 맞추기 위해 소프트 및 하드 제약 함수를 적용한다.

실험 결과

연구 질문

  • RQ1하드웨어 구성 요소를 고정함으로써 플랫폼 인식 신경망 아키텍처 탐색의 성능과 효율성은 어떻게 제한되는가?
  • RQ2에지 가속기에서 신경망 아키텍처와 하드웨어 가속기 구성 요소를 공동 최적화하면 정확도, 지연, 에너지 효율성은 어느 정도 향상되는가?
  • RQ3다양한 사용 사례(예: 소형 대 대형 모델, 다양한 작업)는 최적의 하드웨어 및 모델 구성 요소에 어떤 영향을 미치는가?
  • RQ4신경망 아키텍처와 하드웨어 파rameter를 통합한 통합 탐색 공간이 순차적 또는 별도 최적화보다 더 나은 파레토 최적 해를 도출할 수 있는가?
  • RQ5NAS 탐색 전략의 선택(예: one-shot 대 다중 시도)은 다양한 지연 및 에너지 제약 조건 하에서 성능과 확장성에 어떻게 영향을 미치는가?

주요 결과

  • NAHAS는 모든 지연 목표에서 기존 최고 수준의 모델(예: EfficientNet 포함)보다 1% 높은 ImageNet top-1 정확도를 달성한다.
  • NAHAS는 동일한 정확도를 유지하면서 기준 가속기 대비 에너지 소비를 최대 2배까지 감소시켜 뚜렷한 효율성 향상을 보였다.
  • 공동 탐색은 순차적 또는 고정 구성 방법보다 항상 우수했으며, 단계별 탐색 방법은 탐색 예산을 두 배로 늘여도 여전히 열등한 성능을 보였다.
  • 최적의 하드웨어 구성 요소는 모델 크기와 작업 유형에 따라 크게 달라진다: 소형 모델은 더 많은 PE와 더 적은 메모리가 필요하고, 대형 모델은 더 큰 로컬 메모리와 레지스터 파일에서 유리하다.
  • Squeeze-and-Excite 및 Swish 비선형성과 같은 계산 비용이 높은 연산을 제거하면 정확도를 유지하면서 추론 지연과 에너지 효율성을 향상시킬 수 있다.
  • 일부 모델에 대해서는 one-shot NAS가 다중 시도 NAS보다 더 효과적이지만, 슈퍼 네트워크 구축 비용이 크기 때문에 대규모 모델에는 실용성이 떨어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.