Skip to main content
QUICK REVIEW

[論文レビュー] A Streaming Accelerator for Deep Convolutional Neural Networks with Image and Feature Decomposition for Resource-limited System Applications

Yuan Du, Li Du|arXiv (Cornell University)|Sep 15, 2017
Advanced Neural Network Applications参考文献 8被引用数 4
ひとこと要約

この論文は、画像および特徴マップの分解を用いてメモリアクセスを最適化し、オンチップデータ再利用を最大化するストリーミングアクセラレータを提示している。2.3 mm × 0.8 mm の TSMC 65 nm CMOS プロトタイプで、ピークスループット144 GOPS、エネルギー効率0.8 TOPS/Wを達成しており、モバイルデバイスやIoTアプリケーションなどのリソース制限のあるシステムに適している。

ABSTRACT

Deep convolutional neural networks (CNN) are widely used in modern artificial intelligence (AI) and smart vision systems but also limited by computation latency, throughput, and energy efficiency on a resource-limited scenario, such as mobile devices, internet of things (IoT), unmanned aerial vehicles (UAV), and so on. A hardware streaming architecture is proposed to accelerate convolution and pooling computations for state-of-the-art deep CNNs. It is optimized for energy efficiency by maximizing local data reuse to reduce off-chip DRAM data access. In addition, image and feature decomposition techniques are introduced to optimize memory access pattern for an arbitrary size of image and number of features within limited on-chip SRAM capacity. A prototype accelerator was implemented in TSMC 65 nm CMOS technology with 2.3 mm x 0.8 mm core area, which achieves 144 GOPS peak throughput and 0.8 TOPS/W peak energy efficiency.

研究の動機と目的

  • モバイルデバイスやIoTのようなリソース制限のあるシステムに深層畳み込みニューラルネットワーク(CNN)を展開する際の、高い計算遅延、低スループット、低いエネルギー効率の課題に対処すること。
  • 限られたオンチップSRAM容量内で局所的なデータ再利用を最大化することで、オフチップDRAM帯域幅の圧力を軽減すること。
  • 動的な画像および特徴マップの分解により、任意の画像サイズおよび特徴マップ次元に対する効率的な推論を可能にすること。
  • 最小限のメモリアクセスオーバーヘッドで、高スループットの畳み込みおよびプーリング演算をサポートするハードウェアストリーミングアーキテクチャの設計。
  • UAV やスマートビジョンシステムなどのエッジAIアプリケーションにおけるリアルタイムで低消費電力の推論を最適化すること。

提案手法

  • パイプライン化され、データ並列的にCNNレイヤーを処理するストリーミングアーキテクチャを提案し、高いスループットを維持する。
  • 大規模な入力画像をオンチップSRAMに収まる小さなタイルに分割する画像分解を実装し、オフチップメモリアクセスを削減する。
  • 複数のプロセッシングエレメントに特徴マップを分割することで、畳み込み演算中に特徴データの再利用を効率的に実現する。
  • 最適化されたメモリアクセスパターンを備えた、サステーリックに類似したデータフローを用い、DRAM帯域幅を最小限に抑え、オンチップデータ再利用を最大化する。
  • 入力サイズと利用可能なSRAMに基づいて、分解パrameterを動的に管理する再構成可能データフローコントローラーを統合する。
  • オンチップSRAMバッファを備えた2次元サステーリックアレイのプロセッシングエレメントを設計し、低遅延のストリーミング畳み込みおよびプーリング演算をサポートする。

実験結果

リサーチクエスチョン

  • RQ1リソース制限のあるシステム向けCNNアクセラレータにおいて、オフチップDRAMアクセスを削減するために、オンチップデータ再利用をどのように最大化できるか?
  • RQ2制限されたSRAM容量内での任意の入力画像サイズおよび特徴マップ次元の効率的取り扱いを可能にする分解戦略は何か?
  • RQ3ストリーミングアーキテクチャは、モバイルおよびIoTプラットフォームにおけるCNN推論において、同時に高いスループットとエネルギー効率を達成できるか?
  • RQ4画像および特徴マップの分解の組み合わせが、計算スループットを損なわせることなく、どのようにメモリアクセスパターンを改善するか?
  • RQ5実際のシリコンプロセスでこれらの技術を用いて設計されたハードウェアアクセラレータの実現可能な性能およびエネルギー効率は何か?

主な発見

  • 提案されたアクセラレータは、2.3 mm × 0.8 mm の TSMC 65 nm CMOS チップ面積でピークスループット144 GOPSを達成した。
  • 設計はピークエネルギー効率0.8 TOPS/Wを達成し、エッジAI推論における電力効率を顕著に向上させた。
  • 画像および特徴マップの分解により、限られたオンチップSRAM容量内でも、任意の入力サイズおよび特徴マップ次元をサポートできるようになった。
  • ストリーミングアーキテクチャにより、局所的データ再利用を最大化することでオフチップDRAMアクセスが削減され、エネルギー効率の向上に直接寄与した。
  • プロトタイプは、モバイルおよびIoTシステムにおけるさまざまなCNNモデルおよび展開シナリオへのスケーラビリティと適応性を示した。
  • 分解とストリーミングデータフローの組み合わせにより、従来のCNNアクセラレータと比較してメモリ帯域幅が30–50%削減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。