[論文レビュー] Eyeriss v2: A Flexible Accelerator for Emerging Deep Neural Networks on Mobile Devices
Eyeriss v2 は、階層的メッシュオンチップネットワークとネイティブな圧縮ドメイン処理を用いて、コンパクトでスパースなディープニューラルネットワークをサポートする、モバイルデバイス向けの柔軟なDNNアクセラレータである。65nm CMOSプロセスで、MobileNet上で1秒間に1470.6インファレンス、1ジュールあたり2560.3インファレンスを達成し、オリジナルのEyerissと比較して12.6倍のスループットと2.5倍のエネルギー効率の向上を実現した。
A recent trend in DNN development is to extend the reach of deep learning applications to platforms that are more resource and energy constrained, e.g., mobile devices. These endeavors aim to reduce the DNN model size and improve the hardware processing efficiency, and have resulted in DNNs that are much more compact in their structures and/or have high data sparsity. These compact or sparse models are different from the traditional large ones in that there is much more variation in their layer shapes and sizes, and often require specialized hardware to exploit sparsity for performance improvement. Thus, many DNN accelerators designed for large DNNs do not perform well on these models. In this work, we present Eyeriss v2, a DNN accelerator architecture designed for running compact and sparse DNNs. To deal with the widely varying layer shapes and sizes, it introduces a highly flexible on-chip network, called hierarchical mesh, that can adapt to the different amounts of data reuse and bandwidth requirements of different data types, which improves the utilization of the computation resources. Furthermore, Eyeriss v2 can process sparse data directly in the compressed domain for both weights and activations, and therefore is able to improve both processing speed and energy efficiency with sparse models. Overall, with sparse MobileNet, Eyeriss v2 in a 65nm CMOS process achieves a throughput of 1470.6 inferences/sec and 2560.3 inferences/J at a batch size of 1, which is 12.6x faster and 2.5x more energy efficient than the original Eyeriss running MobileNet. We also present an analysis methodology called Eyexam that provides a systematic way of understanding the performance limits for DNN processors as a function of specific characteristics of the DNN model and accelerator design; it applies these characteristics as sequential steps to increasingly tighten the bound on the performance limits.
研究の動機と目的
- コンパクトでスパースなニューラルネットワークモデルの増加に伴う、モバイルデバイスにおける効率的なDNNアクセラレーションの需要に対応すること。
- 固定で大きなDNNレイヤー形状を仮定する既存のアクセラレータの限界を克服し、スパarsityと可変なデータ再利用をサポートしないこと。
- 現代のDNNにおける多様なレイヤー寸法や形状に動的に適応できるハードウェアアーキテクチャを設計すること。
- 圧縮形式のままスパースな重みと活性化値を直接処理できるようにし、エネルギー効率とスループットを向上させること。
- さまざまなDNNワークロードとバッチサイズにおいて、高いリソース利用率を維持するためのデータフローとメモリアクセスパターンを最適化すること。
提案手法
- 異なるDNNレイヤー種別や形状に応じた変動するデータ再利用と帯域要件に適応可能な階層的メッシュネットワークを導入すること。
- 重みと活性化の両方のスパースデータを圧縮ドメインでネイティブに処理し、展開のオーバーヘッドを回避すること。
- 複数のデータフロー(WS、OS、IS、ロウステーショナリ)をサポートする柔軟なデータフローマッピング戦略を採用し、レイヤー固有の再利用パターンに動的に適応すること。
- 効率的なデータ配信を実現するため、マルチキャストとブロードキャストを両方サポートするNoC(On-Chip Network)を設計し、再利用の活用と帯域制限の両立を図ること。
- Eyexamフレームワークを用いて、さまざまなデータフローとPEアレイ構成におけるパフォーマンスボトルネックを分析・定量すること。
- 有限なPEアレイと物理的アレイ寸法に起因するパフォーマンス損失を最小限に抑えるため、マイクロアーキテクチャを最適化すること。
実験結果
リサーチクエスチョン
- RQ1コンパクトでスパースなDNNモデルにおいて、多様で変動するレイヤー形状やサイズを有する場合に、どのようにして高いパフォーマンスとエネルギー効率を維持できるか?
- RQ2スパースDNNを圧縮形式のまま処理できるような、どのようなアーキテクチャ的特徴が効率的な処理を可能にするか?
- RQ3PEアレイのスケーリングと低データ再利用のレイヤー(例:全結合層)をサポートする際、データフロー選択とNoCトポロジーの選定がパフォーマンスに与える影響はいかほどか?
- RQ4柔軟なオンチップネットワークは、マッピングの断片化や物理的アレイ制限に起因するパフォーマンス損失をどの程度緩和できるか?
- RQ5構造が可変なDNN向けのNoC設計において、データ再利用の活用と帯域効率の間にはどのようなトレードオフが存在するか?
主な発見
- Eyeriss v2 は、バッチサイズ1でMobileNet上で1秒間に1470.6インファレンス、1ジュールあたり2560.3インファレンスを達成し、オリジナルのEyerissと比較して12.6倍のスループット向上と2.5倍のエネルギー効率向上を実現した。
- 階層的メッシュネットワークにより、多様なレイヤー形状に応じた帯域と再利用の適応的サポートが可能となり、マッピング断片化に起因するパフォーマンス損失が低減された。
- スパースな重みと活性化のネイティブな圧縮ドメイン処理により、展開のオーバーヘッドが完全に排除され、エネルギー効率が顕著に向上した。
- 特に小規模な特徴マップや少ないチャネル数を持つレイヤーにおいても、柔軟なデータフローマッピングにより、有限なPEアレイと物理的アレイ寸法に起因するパフォーマンス損失が最小限に抑えられた。
- NoC設計は、データ再利用の活用と帯域配信の両立に成功し、全結合層など低再利用のシナリオでもボトルネックを回避した。
- Eyexamフレームワークの分析から、単にPE数を増やしても、マッピングや物理的制約が rigid なデータフローアーキテクチャではスケーラビリティが制限され、パフォーマンス向上が保証されないことが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。