[論文レビュー] Tartan: Accelerating Fully-Connected and Convolutional Layers in Deep Learning Networks by Exploiting Numerical Precision Variability
Tartan (TRT) は、各層ごとに動的に数値精度を調整することで、完全結合層および畳み込み層の高速化を実現するハードウェアアクセラレータである。ハイブリッド・ビット・シリアル/ビット並列処理ユニットを用い、1.90×の高速化と、最先端のビット並列アクセラレータ比で1.17×のエネルギー効率向上を達成しており、性能を求める際には1%の精度損失を許容することでさらなる向上が得られる。
Tartan (TRT), a hardware accelerator for inference with Deep Neural Networks (DNNs), is presented and evaluated on Convolutional Neural Networks. TRT exploits the variable per layer precision requirements of DNNs to deliver execution time that is proportional to the precision p in bits used per layer for convolutional and fully-connected layers. Prior art has demonstrated an accelerator with the same execution performance only for convolutional layers. Experiments on image classification CNNs show that on average across all networks studied, TRT outperforms a state-of-the-art bit-parallel accelerator by 1:90x without any loss in accuracy while it is 1:17x more energy efficient. TRT requires no network retraining while it enables trading off accuracy for additional improvements in execution performance and energy efficiency. For example, if a 1% relative loss in accuracy is acceptable, TRT is on average 2:04x faster and 1:25x more energy efficient than a conventional bit-parallel accelerator. A Tartan configuration that processes 2-bits at time, requires less area than the 1-bit configuration, improves efficiency to 1:24x over the bit-parallel baseline while being 73% faster for convolutional layers and 60% faster for fully-connected layers is also presented.
研究の動機と目的
- 層ごとの精度要件に応じて固定精度処理を採用する既存のDNNアクセラレータの性能およびエネルギー効率の制限を解消すること。
- 各層で使用する精度(ビット数)に応じて実行時間を動的にスケーリングすることで、性能およびエネルギー効率の向上を実現すること。
- 従来のビットシリアルアクセラレータの研究を発展させ、畳み込み層および完全結合層の両方を効率的に処理可能にし、完全結合層におけるエネルギー非効率性を克服すること。
- ネットワークの再トレーニングを必要とせず、実行時における精度・性能・エネルギー効率の間で柔軟にトレードオフを可能にするハードウェアソリューションを提供すること。
- 標準的なメモリインターフェースと互換性を持たせつつ、効率的なメモリアクセスを実現し、可変精度演算を可能にすること。
提案手法
- 重みおよび活性化の両方の処理に1ビットおよび複数ビット精度をサポートするハイブリッド・ビットシリアル/ビット並列機能ユニットアーキテクチャを設計する。
- スレーブ内積(SIP)ユニットを段階的に接続することで、出力計算のスライシングを可能にし、小規模な層におけるライン間のアンバランスを低減し、リソースの利用効率を向上させる。
- Juddらが提案した感受性解析に基づき、各層ごとの最適な精度を決定する手法を実装する[11]。
- ビット並列アクセラレータと同一のメモリインターフェースおよびワイヤ数を維持することで、相互運用性を確保し、オフチップ帯域幅の増加を回避する。
- 実行時間を精度 p と反比例させるようにスケーリングし、畳み込み層および完全結合層の両方で16ビットベースライン比で理想的な高速化 16/p を達成する。
- 推論中に精度を動的に調整可能にし、精度・性能・エネルギー効率の間の実行時トレードオフを可能にする。
実験結果
リサーチクエスチョン
- RQ1DNN の異なる層における可変精度要件を活用することで、ハードウェアアクセラレータが性能およびエネルギー効率の向上を達成できるか?
- RQ2ビットシリアル処理を効果的に完全結合層に拡張することで、従来のビットシリアル設計で観察されたエネルギー非効率性を克服できるか?
- RQ3動的精度スケーリングによって、モデルの精度を損なわずに推論時間およびエネルギー消費をどの程度削減できるか?
- RQ41つのアクセラレータアーキテクチャが、さまざまな精度要件を満たす畳み込み層および完全結合層を効率的に処理できるか? また、高いメモリ帯域幅を維持し、面積オーバーヘッドを低く抑えることができるか?
- RQ5DNN 推論において、わずかな精度損失を許容することで、速度および効率を向上させた場合の性能およびエネルギー効率の向上はどの程度か?
主な発見
- TRT は、画像分類用 CNN の全層において、最先端のビット並列アクセラレータ(DaDN)比で平均1.90×の高速化と1.17×のエネルギー効率向上を達成した。
- 完全結合層では、TRT は DaDN に対して1.61×の高速化と1.06×のエネルギー効率向上を達成した。
- 畳み込み層では、TRT は DaDN に対して1.91×の高速化と1.18×のエネルギー効率向上を達成した。
- 1%の相対的精度損失を許容した場合、TRT はビット並列ベースライン比で2.04×の高速化と1.25×のエネルギー効率向上を達成した。
- 2ビットのTRT構成は、1ビットベースライン比で畳み込み層で73%高速、完全結合層で60%高速であり、エネルギー効率は1.24×向上した。
- TRT は、精度スケーリングを動的に実行可能であり、その結果が直接的に性能およびエネルギーの節約に繋がり、推論ワークロードにおける新たな柔軟性を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。