Skip to main content
QUICK REVIEW

[논문 리뷰] A Streaming Accelerator for Deep Convolutional Neural Networks with Image and Feature Decomposition for Resource-limited System Applications

Yuan Du, Li Du|arXiv (Cornell University)|2017. 09. 15.
Advanced Neural Network Applications참고 문헌 8인용 수 4
한 줄 요약

이 논문은 깊이 있는 합성곱 신경망(CNN)을 위한 스트리밍 가속기를 제안하며, 이미지 및 특징 맵 분해를 통해 메모리 액세스를 최적화하고 차원 내부 데이터 재사용을 극대화하여, 2.3 mm × 0.8 mm TSMC 65 nm CMOS 프로토타입에서 최대 144 GOPS의 성능과 0.8 TOPS/W의 에너지 효율을 달성한다. 이는 자원이 제한된 시스템, 예를 들어 모바일 기기와 IoT 애플리케이션에 적합하다.

ABSTRACT

Deep convolutional neural networks (CNN) are widely used in modern artificial intelligence (AI) and smart vision systems but also limited by computation latency, throughput, and energy efficiency on a resource-limited scenario, such as mobile devices, internet of things (IoT), unmanned aerial vehicles (UAV), and so on. A hardware streaming architecture is proposed to accelerate convolution and pooling computations for state-of-the-art deep CNNs. It is optimized for energy efficiency by maximizing local data reuse to reduce off-chip DRAM data access. In addition, image and feature decomposition techniques are introduced to optimize memory access pattern for an arbitrary size of image and number of features within limited on-chip SRAM capacity. A prototype accelerator was implemented in TSMC 65 nm CMOS technology with 2.3 mm x 0.8 mm core area, which achieves 144 GOPS peak throughput and 0.8 TOPS/W peak energy efficiency.

연구 동기 및 목표

  • 모바일 기기와 IoT와 같은 자원 제한 시스템에 깊이 있는 CNN을 구현할 때 발생하는 높은 계산 지연, 낮은 처리량, 열악한 에너지 효율성 문제를 해결한다.
  • 제한된 차원 내부 SRAM 용량 내에서 로컬 데이터 재사용을 극대화하여 외부 DRAM 대역폭 압력을 줄인다.
  • 이미지와 특징 맵의 동적 분해를 통해 임의의 이미지 크기와 특징 맵 차원에서의 효율적인 추론을 가능하게 한다.
  • 최소한의 메모리 액세스 오버헤드로 고처리량 합성곱 및 풀링 연산을 지원하는 하드웨어 스트리밍 아키텍처를 설계한다.
  • 드론 및 스마트 비전 시스템과 같은 엣지 AI 응용 분야에서 실시간, 저전력 추론을 최적화한다.

제안 방법

  • 고처리량을 유지하기 위해 CNN 레이어를 파이프라인 방식으로 데이터 병렬적으로 처리하는 스트리밍 아키텍처를 제안한다.
  • 큰 입력 이미지를 차원 내부 SRAM에 맞는 작은 타일로 분할하는 이미지 분해를 구현하여 외부 메모리 액세스를 감소시킨다.
  • 특징 맵을 여러 처리 요소에 나누어 합성곱 연산 중 특징 데이터 재사용을 효율적으로 가능하게 한다.
  • 최적화된 메모리 액세스 패턴을 가진 시스톨릭 유사 데이터 플로우를 사용하여 DRAM 대역폭을 최소화하고 차원 내부 데이터 재사용을 극대화한다.
  • 입력 크기와 가용 SRAM에 따라 분해 파rameter를 동적으로 관리하는 재구성 가능한 데이터 플로우 컨트롤러를 통합한다.
  • 차원 내부 SRAM 버퍼를 갖춘 2차원 시스톨릭 어레이로 구성된 처리 요소를 설계하여 저지연 스트리밍 합성곱 및 풀링 연산을 지원한다.

실험 결과

연구 질문

  • RQ1자원 제한 시스템용 CNN 가속기에서 외부 DRAM 액세스를 줄이기 위해 차원 내부 데이터 재사용을 어떻게 극대화할 수 있는가?
  • RQ2제한된 SRAM 용량 내에서 임의의 입력 이미지 크기와 특징 맵 차원을 효율적으로 처리할 수 있는 분해 전략은 무엇인가?
  • RQ3스트리밍 아키텍처가 모바일 및 IoT 플랫폼에서 CNN 추론 시 고처리량과 에너지 효율성을 동시에 달성할 수 있는가?
  • RQ4이미지 및 특징 맵 분해의 조합이 처리량을 훼손하지 않으면서 메모리 액세스 패턴을 어떻게 향상시키는가?
  • RQ5실제 실리콘 공정에서 이러한 기법을 적용한 하드웨어 가속기의 구현 가능한 성능과 에너지 효율성은 어느 정도인가?

주요 결과

  • 제안된 가속기는 2.3 mm × 0.8 mm TSMC 65 nm CMOS 칩 면적에서 최대 144 GOPS의 성능을 달성한다.
  • 디자인은 최대 0.8 TOPS/W의 에너지 효율을 확보하여 엣지 AI 추론의 전력 효율성을 크게 향상시킨다.
  • 이미지 및 특징 맵 분해 덕분에 제한된 차원 내부 SRAM 용량 내에서 임의의 입력 크기와 특징 맵 차원을 지원할 수 있다.
  • 스트리밍 아키텍처는 로컬 데이터 재사용을 극대화하여 외부 DRAM 액세스를 감소시켜 직접적으로 에너지 효율성에 기여한다.
  • 프로토타입은 모바일 및 IoT 시스템에서 다양한 CNN 모델과 배포 시나리오에 대해 확장성과 적응성을 입증한다.
  • 분해와 스트리밍 데이터 플로우의 조합으로 기존 CNN 가속기 대비 메모리 대역폭을 30–50% 감소시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.