[論文レビュー] Rethinking Floating Point Overheads for Mixed Precision DNN Accelerators
本論文は、低ビット整数演算の時間的分解能を活用することで、最小限のハードウェアオーバーヘッドでFP16演算を効率的にサポートするミックスドプレシジョン畳み込みユニットを提案する。実際の応用では最大8ビットの指数差しか発生しないことに着目し、アライメント論理の複雑さを低減した。これにより、従来設計と比較して最大46%高いTOPS/mm²および63%高いTOPS/W効率を達成した。
In this paper, we propose a mixed-precision convolution unit architecture which supports different integer and floating point (FP) precisions. The proposed architecture is based on low-bit inner product units and realizes higher precision based on temporal decomposition. We illustrate how to integrate FP computations on integer-based architecture and evaluate overheads incurred by FP arithmetic support. We argue that alignment and addition overhead for FP inner product can be significant since the maximum exponent difference could be up to 58 bits, which results into a large alignment logic. To address this issue, we illustrate empirically that no more than 26-bitproduct bits are required and up to 8-bit of alignment is sufficient in most inference cases. We present novel optimizations based on the above observations to reduce the FP arithmetic hardware overheads. Our empirical results, based on simulation and hardware implementation, show significant reduction in FP16 overhead. Over typical mixed precision implementation, the proposed architecture achieves area improvements of up to 25% in TFLOPS/mm2and up to 46% in TOPS/mm2with power efficiency improvements of up to 40% in TFLOPS/Wand up to 63% in TOPS/W.
研究の動機と目的
- 低精度整数ベースのDNNアクセラレータにおけるFP16演算サポートに伴う高いハードウェアオーバーヘッドを解消すること。
- 実世界のDNN推論ワークロードにおける指数差の実際の動的範囲を特定すること。
- 精度を損なわずにFP16内積ユニットにおけるアライメントおよび加算論理のオーバーヘッドを最小限に抑えること。
- INT4最適化アーキテクチャにおけるFP16サポートコストを低減することで、効率的なミックスドプレシジョン推論を可能にすること。
- 選択的FP16使用により、FP32レベルの精度を維持しながらDNNアクセラレータの面積およびパワー効率を向上させること。
提案手法
- 時間的分解能を用いて高精度演算をサポートする低ビット(例:INT4)内積ユニットに基づく畳み込みユニットの設計。
- 4ビットの細粒度演算を基本ユニットとして、時間的に高精度演算をエミュレートする。
- 実DNNワークロードを分析し、最大指数差が8ビットを rarely 超えないことに着目して、縮小された幅のアライメントユニットを実装。
- 理論的な最大58ビットではなく、観察された8ビットのアライメント範囲に合わせてアドダーツリーの精度を最適化。
- 既存の低精度乗算器および累積器論理を再利用することで、整数ベースのアーキテクチャにFP16サポートを最小限の面積およびパワーオーバーヘッドで統合。
- シミュレーションおよびハードウェア実装を通じた設計の検証により、面積、パワー、パフォーマンスの向上を測定。
実験結果
リサーチクエスチョン
- RQ1一般的なDNN推論ワークロードにおけるFP16積の指数差の実際の動的範囲は何か?
- RQ2実際のFP16内積演算において、アライメント論理にどれほど必要なのか?
- RQ3過度な面積およびパワーオーバーヘッドを伴わずに、低精度整数ベースのDNNアクセラレータでFP16演算を効率的にサポートできるか?
- RQ4時間的分解能は、ミックスドプレシジョン演算のハードウェアコストをどれくらい低減できるか?
- RQ5INT4最適化アーキテクチャにおいてFP16サポート論理を最小限に抑えた場合のパフォーマンスおよび効率的向上はどの程度か?
主な発見
- 実際のDNNワークロードにおけるFP16積の最大指数差は、理論的な最大58ビットとは異なり、通常8ビット未満である。
- FP16演算には最大26ビットの積ビットで十分であり、中間計算の精度を低減可能。
- 提案アーキテクチャはFP16アライメント論理を8ビットシフトユニットにまで簡略化し、面積およびパワーオーバーヘッドを顕著に削減。
- 標準的なミックスドプレシジョン実装と比較して、最大25%のTFLOPS/mm²向上および最大46%のTOPS/mm²向上を達成。
- TFLOPS/Wでは最大40%、TOPS/Wでは最大63%のパワー効率向上を達成し、顕著なエネルギー効率向上を示した。
- 最適化は分解能スキームとは直交しており、時間的および空間的統合の両方のアプローチに適用可能。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。