Skip to main content
QUICK REVIEW

[논문 리뷰] Learned Hardware/Software Co-Design of Neural Accelerators

Zhan Shi, Chirag Sakhuja|arXiv (Cornell University)|2020. 10. 05.
Advanced Neural Network Applications참고 문헌 41인용 수 8
한 줄 요약

이 논문은 신경망 가속기의 공동 하드웨are/소프트웨어 공동 설계를 위한 제약 조건이 있는 베이지안 최적화 프레임워크를 제안한다. 이는 에너지-지연 제품을 최소화하기 위해 광범위하고 반연속적인 설계 공간인 하드웨어 아키텍처와 소프트웨어 매핑을 자동으로 탐색한다. 다양한 모델, 특히 ResNet과 DQN을 포함하여 수동으로 최적화된 최신 기술 대비 에너지-지연 제품에서 18%에서 40% 향상된다.

ABSTRACT

The use of deep learning has grown at an exponential rate, giving rise to numerous specialized hardware and software systems for deep learning. Because the design space of deep learning software stacks and hardware accelerators is diverse and vast, prior work considers software optimizations separately from hardware architectures, effectively reducing the search space. Unfortunately, this bifurcated approach means that many profitable design points are never explored. This paper instead casts the problem as hardware/software co-design, with the goal of automatically identifying desirable points in the joint design space. The key to our solution is a new constrained Bayesian optimization framework that avoids invalid solutions by exploiting the highly constrained features of this design space, which are semi-continuous/semi-discrete. We evaluate our optimization framework by applying it to a variety of neural models, improving the energy-delay product by 18% (ResNet) and 40% (DQN) over hand-tuned state-of-the-art systems, as well as demonstrating strong results on other neural network architectures, such as MLPs and Transformers.

연구 동기 및 목표

  • 기존의 하드웨어와 소프트웨어 최적화를 별도로 수행하는 방식의 한계를 해결하기 위해, 수익성이 있는 공동 설계 포인트를 탐색하지 못하는 문제를 해결한다.
  • DNN 가속기 하드웨어 및 소프트웨어 구성의 매우 제약된, 반연속/반산연한 설계 공간을 체계적이고 자동으로 탐색할 수 있도록 한다.
  • 에너지-지연 제품(EDP) 향상을 위해 하드웨어 가속기와 소프트웨어 매핑을 공동으로 설계하는 확장 가능하고 원리적인 최적화 프레임워크를 개발한다.
  • 학습된 공동 설계가 다양한 신경망 모델에서 새로운 고성능 아키텍처를 도출하고 히ュ리스틱 기반 최적화 도구를 능가할 수 있음을 보여준다.

제안 방법

  • 처리 요소(PE) 어레이 레이아웃, 버퍼 크기, 루프 타일링, 데이터 플로우 패턴 등을 포함한 매개변수화된 구성으로 하드웨어 및 소프트웨어 설계 공간을 수식화한다.
  • 내부 루프가 특정 아키텍처에 대해 소프트웨어 매핑을 최적화하고, 외부 루프가 하드웨어 아키텍처를 최적화하는 이중 레벨 베이지안 최적화 프레임워크를 도입한다.
  • 서브모델과 할당 함수(예: LCB)를 사용한 제약 조건이 있는 베이지안 최적화를 적용하여, 타당하지 않은 해를 피하면서 설계 공간을 효율적으로 탐색한다.
  • 영역, 에너지 예산, 평가 전까지의 타당성 여부가 알려지지 않은 하드 제약 조건을 고려한 제약 조건 기반 공식화를 통해, 90% 이상의 비타당한 설계 비율을 감소시킨다.
  • 성능(예: 지연, 에너지)을 모델링하고 검색을 고성능이면서도 타당한 구성으로 이끌기 위해 기계 학습을 활용한다.
  • CNN, MLP, 트랜스포머를 포함한 다양한 DNN 아키텍처로의 확장성과 모듈성을 확보하기 위해 접근 방식을 확장한다.

실험 결과

연구 질문

  • RQ1하나의 자동화된 하드웨어/소프트웨어 공동 설계 프레임워크가 기존의 별도 최적화 방식을 능가할 수 있는가?
  • RQ2베이지안 최적화는 신경 가속기 구성의 반산연적이고 매우 제약된 설계 공간을 어떻게 다룰 수 있는가?
  • RQ3종단 간 공동 설계를 통해 수동 최적화된 최신 기술 대비 에너지-지연 제품에서 어떤 성능 향상을 달성할 수 있는가?
  • RQ4제안된 프레임워크는 효율성을 높이는 새로운 비직관적인 하드웨어 및 소프트웨어 구성을 발견할 수 있는가?
  • RQ5ResNet, DQN, MLP, 트랜스포머와 같은 다양한 신경망 아키텍처에 걸쳐 공동 설계 접근 방식은 얼마나 견고한가?

주요 결과

  • 제안된 제약 조건이 있는 베이지안 최적화 프레임워크는 DQN에 대해 수동 최적화된 최신 기술 대비 에너지-지연 제품에서 40.2% 향상되었고, ResNet에선 18% 향상되었다.
  • 이 프레임워크는 탐색하는 비타당한 설계 포인트 수를 90% 이상 감소시켜, 매우 제약된 설계 공간 내에서 검색 효율성을 크게 향상시켰다.
  • 학습된 공동 설계 접근 방식은 Eyeriss와 같은 기존 설계를 능가하는 최적화된 PE 어레이 형상과 버퍼 활용 전략과 같은 새로운 하드웨어 구성도 발견했다.
  • 학습된 하드웨어 구성을 히ュ리스틱 소프트웨어 최적화 도구(예: Timeloop)와 함께 사용할 경우, 최적화 도구가 자체적으로 찾을 수 있는 결과보다 더 좋은 성능을 내어, 다양한 아키텍처에 걸쳐 강건함을 입증했다.
  • 이 방법은 CNN 외에도 MLP 및 트랜스포머와 같은 다양한 모델에서 뛰어난 성능을 내어, 확장성의 타당성을 확인했다.
  • 서브모델과 LCB와 같은 할당 함수의 사용은, 비용이 많이 드는 시뮬레이션 조건이 존재하더라도, 공동 설계 공간의 효율적이고 스케일러블한 탐색을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.