[論文レビュー] Chain-NN: An Energy-Efficient 1D Chain Architecture for Accelerating Deep Convolutional Neural Networks
Chain-NNは、畳み込みニューラルネットワーク(CNN)の高速化を図るために、データ移動を最小限に抑えるための、二重チャネル処理エンジンを備えた1次元チェーンアーキテクチャを提案する。スチルティックプリミティブと列方向の入力スキャンを用いる。TSMC 28nmで合成された576-PE実装は、567.5mWで806.4 GOPSの性能を達成し、1421.0 GOPS/Wの効率を示す。これは、最先端のアクセラレータと比較して2.5〜4.1倍優れている。
Deep convolutional neural networks (CNN) have shown their good performances in many computer vision tasks. However, the high computational complexity of CNN involves a huge amount of data movements between the computational processor core and memory hierarchy which occupies the major of the power consumption. This paper presents Chain-NN, a novel energy-efficient 1D chain architecture for accelerating deep CNNs. Chain-NN consists of the dedicated dual-channel process engines (PE). In Chain-NN, convolutions are done by the 1D systolic primitives composed of a group of adjacent PEs. These systolic primitives, together with the proposed column-wise scan input pattern, can fully reuse input operand to reduce the memory bandwidth requirement for energy saving. Moreover, the 1D chain architecture allows the systolic primitives to be easily reconfigured according to specific CNN parameters with fewer design complexity. The synthesis and layout of Chain-NN is under TSMC 28nm process. It costs 3751k logic gates and 352KB on-chip memory. The results show a 576-PE Chain-NN can be scaled up to 700MHz. This achieves a peak throughput of 806.4GOPS with 567.5mW and is able to accelerate the five convolutional layers in AlexNet at a frame rate of 326.2fps. 1421.0GOPS/W power efficiency is at least 2.5 to 4.1x times better than the state-of-the-art works.
研究の動機と目的
- オフチップメモリ帯域幅の低減を通じて、ディープCNN推論におけるエネルギー消費を削減すること。
- CNNアクセラレータにおけるプロセッサとメモリ階層間のデータ移動にかかる高コストな電力消費を是正すること。
- さまざまなCNNレイヤー構成を効率的にサポートできる、スケーラブルで再構成可能なアーキテクチャを設計すること。
- リソース制約のあるプラットフォームにおけるリアルタイムCNN推論を実現する、高いスループットとエネルギー効率を達成すること。
提案手法
- 畳み込み演算を実行するために、二重チャネルのスチルティックアレイに配置された1次元チェーン型プロセッシングエレメント(PE)を採用する。
- 隣接するPEから構成される1次元スチルティックプリミティブを用い、データ再利用を最適化した畳み込み処理を実現する。
- 入力特徴マップの再利用を最大化し、メモリアクセスを削減するために、列方向スキャン入力パターンを導入する。
- 異なるCNNレイヤー寸法に対応できるように、設計の複雑さを最小限に抑えつつ、容易に再構成可能なアーキテクチャを設計する。
- TSMC 28nmプロセスで実装し、3751kの論理ゲートと352KBのオンチップメモリを用いて、面積と電力の効率的使用を実現する。
実験結果
リサーチクエスチョン
- RQ1CNNアクセラレータにおけるデータ移動をどのように低減すればエネルギー消費を削減できるか?
- RQ2スチルティックプリミティブを備えた1次元チェーンアーキテクチャは、多様なCNNレイヤーに対して高いスループットとエネルギー効率を達成できるか?
- RQ3列方向スキャン入力パターンは、どれほどデータ再利用を向上させ、メモリ帯域幅を削減できるか?
- RQ41次元チェーンアーキテクチャの再構成性は、設計の複雑さと異なるネットワークへの適応性にどのような影響を及えるか?
主な発見
- 576-PEのChain-NN実装は、TSMC 28nmプロセスで700MHzで動作し、ピークスループット806.4 GOPSを達成した。
- 消費電力はわずか567.5mWであり、パワー効率は1421.0 GOPS/Wとなった。
- エネルギー効率は、最先端のCNNアクセラレータと比較して2.5〜4.1倍優れている。
- アーキテクチャは、AlexNetの5つの畳み込みレイヤーをすべて326.2fpsで加速し、リアルタイム推論を可能にした。
- 列方向スキャン入力パターンにより、オペランド再利用が強化され、メモリ帯域幅の要件が顕著に削減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。