Skip to main content
QUICK REVIEW

[논문 리뷰] Apollo: Transferable Architecture Exploration

Amir Yazdanbakhsh, Christof Angermueller|arXiv (Cornell University)|2021. 02. 02.
Advanced Neural Network Applications참고 문헌 41인용 수 13
한 줄 요약

Apollo는 다양한 제약 조건 하에서 샘플 효율적인 커스텀 신경망 가속기 설계를 가능하게 하는 전이 가능한 아키텍처 탐색 프레임워크이다. 블랙박스 최적화를 활용하여 최대 24.6%의 성능 향상을 이끌어내며, 전체 탐색 공간의 약 0.0004%에 해당하는 샘플만을 사용한다. 또한 다양한 설계 제약 조건 간 전이 학습을 통해 최적화 효율을 최대 25% 향상시킨다.

ABSTRACT

The looming end of Moore's Law and ascending use of deep learning drives the design of custom accelerators that are optimized for specific neural architectures. Architecture exploration for such accelerators forms a challenging constrained optimization problem over a complex, high-dimensional, and structured input space with a costly to evaluate objective function. Existing approaches for accelerator design are sample-inefficient and do not transfer knowledge between related optimizations tasks with different design constraints, such as area and/or latency budget, or neural architecture configurations. In this work, we propose a transferable architecture exploration framework, dubbed Apollo, that leverages recent advances in black-box function optimization for sample-efficient accelerator design. We use this framework to optimize accelerator configurations of a diverse set of neural architectures with alternative design constraints. We show that our framework finds high reward design configurations (up to 24.6% speedup) more sample-efficiently than a baseline black-box optimization approach. We further show that by transferring knowledge between target architectures with different design constraints, Apollo is able to find optimal configurations faster and often with better objective value (up to 25% improvements). This encouraging outcome portrays a promising path forward to facilitate generating higher quality accelerators.

연구 동기 및 목표

  • 비용이 많이 들고 고차원적이며 제약 조건이 많은 탐색 공간에서 샘플 비효율적이고 전이 불가능한 가속기 아키텍처 탐색 문제를 해결한다.
  • 신경망 가속기 설계를 위한 다양한 최적화 전략을 지원하는 일반 목적의 프레임워크를 개발한다.
  • 다른 설계 제약 조건(예: 면적, 지연 시간)을 가진 아키텍처 탐색 작업 간 전이 학습을 가능하게 하여 샘플 효율성과 최적화 품질을 향상시킨다.
  • 전이 가능한 최적화가 더 높은 성능을 달성하면서도 더 비싼 하드웨어 평가 횟수를 줄일 수 있음을 입증한다.
  • 스케줄링과 매핑을 포함한 전체 컴퓨팅 스택을 공최적화할 수 있는 기반을 마련하기 위해 전이 가능한 설계 탐색을 통해 가속기 공최적화를 가능하게 한다.

제안 방법

  • 면적 및 지연 시간 제약 조건 하에서 지연 시간 또는 런타임을 최소화하는 제약 조건이 있는 블랙박스 최적화 문제로 가속기 아키텍처 탐색을 수식화한다.
  • 랜덤 서치, 베이지안 최적화, 진화 알고리즘, 앙상블 방법 등 다양한 최적화 전략을 지원하는 구성 가능한 종단 간 프레임워크인 Apollo를 구현한다.
  • 처리 요소의 2차원 배열, 다수의 계산 랜드, 전용 레지스터 파일을 갖춘 고도로 파arameter화된 내부 개발 엣지 가속기를 사용하여 탐색 공간을 정의한다.
  • 기존에 해결된 다른 제약 조건을 가진 작업에서의 지식을 활용하여 새로운 작업의 최적화를 초기화함으로써 전이 학습을 적용하고, 빠른 수렴을 가능하게 한다.
  • 고차원적이고 구조적이며 평가 비용이 큰 설계 공간에서의 탐색을 안내하기 위해 서피스 모델링과 확률적 추론을 활용한다.
  • 하드웨어 시뮬레이션을 목표 함수 평가기로 사용하며, 시험 생성 과정에서 타당성 검사를 통해 제약 조건을 준수한다.

실험 결과

연구 질문

  • RQ1블랙박스 최적화 전략이 고성능 가속기 구성 요건을 찾기 위해 필요한 하드웨어 평가 횟수를 크게 줄일 수 있는가?
  • RQ2다른 설계 제약 조건(예: 면적 또는 지연 시간 예산)을 가진 아키텍처 탐색 작업 간 전이 학습이 최적화 효율성과 해의 품질에 어떤 영향을 미치는가?
  • RQ3랜덤 서치, 베이지안 최적화, 진화 알고리즘, 앙상블 방법 중 어떤 최적화 전략이 샘플 효율성과 성능 사이의 최적의 균형을 이룰 수 있는가?
  • RQ4전이 학습이 다양한 신경망 워크로드와 제약 조건에서 최적의 구성 요건을 발견하기 위해 필요한 평가 횟수를 얼마나 줄일 수 있는가?
  • RQ5다양한 신경망 아키텍처(예: MobileNet, 객체 검출, 세그멘테이션, OCR 모델 등)는 전이 가능한 아키텍처 탐색의 효과성에 어떤 영향을 미치는가?

주요 결과

  • Apollo는 전체 탐색 공간의 약 0.0004%에 해당하는 약 2,000회의 하드웨어 평가만으로도 최대 24.6%의 가속기 성능 향상을 달성한다.
  • 진화 및 인구 기반의 블랙박스 최적화 전략이 기준 랜덤 서치를 능가하여 최소한의 평가로 최고의 보상 구성 요건을 도출한다.
  • 다른 설계 제약 조건을 가진 아키텍처 탐색 작업 간 전이 학습은 독립적인 최적화에 비해 최적화 결과를 최대 25% 향상시킨다.
  • 전이 학습은 필요한 하드웨어 평가 횟수를 줄여주며, 특히 더 엄격한 제약 조건 하에서 최적의 구성 요건으로의 수렴을 가속화한다.
  • 이 프레임워크는 다양한 복잡한 가속기 구성 요건의 효과적인 탐색을 가능하게 하며, 진화 알고리즘이 더 다양한 잠재적 설계를 도출한다.
  • Apollo는 관련 최적화 작업 간 지식 전이가 실제 비용이 많이 드는 평가 환경에서 설계 주기 시간을 줄이고 가속기 품질을 향상시키는 데 매우 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.