[論文レビュー] The Challenge of Multi-Operand Adders in CNNs on FPGAs: How not to solve it!
本稿では、FPGAベースのCNNアクセラレータにおけるマルチオペランドアダッタ(MOAs)の高いリソースコストを低減するための2つの戦略——時間多重シリアル化とLOAアダッタを用いた近似計算——を検討する。理論的には有望であるが、実際には両者とも失敗する:シリアル化は過剰な論理回路オーバーヘッドを引き起こし、近似アダッタはFPGAの論理ブロックアーキテクチャのため面積の削減が得られず、結果として現在のFPGAではこれらの手法によるMOA最適化が不適切であることが示された。
Convolutional Neural Networks (CNNs) are computationally intensive algorithms that currently require dedicated hardware to be executed. In the case of FPGA-Based accelerators, we point-out in this work the challenge of Multi-Operand Adders (MOAs) and their high resource utilization in an FPGA implementation of a CNN. To address this challenge, two optimization strategies, that rely on time-multiplexing and approximate computing, are investigated. At first glance, the two strategies looked promising to reduce the footprint of a given architectural mapping, but when synthesized on the device, none of them gave the expected results. Experimental sections analyze the reasons of these unexpected results.
研究の動機と目的
- FPGAベースのCNNアクセラレータにおけるマルチオペランドアダッタ(MOAs)の高いリソース使用量を解決すること。MOAは一部の層で論理リソースの最大69%を消費する。
- 時間多重シリアル化を用いて、複数のクロックサイクルにわたるアダッタハードウェアの再利用により、MOAのフットプリントを縮小する手法を評価すること。
- 下位ビットOR(LOA)アダッタを用いた近似計算を活用し、MOAツリーにおける面積と消費電力の削減を検討すること。
- これらの最適化戦略が、現代のFPGAに合成された際になぜ期待されたリソース削減を達成できないかを特定すること。理論的期待に反して失敗する理由を明らかにすること。
提案手法
- Intel Stratix V FPGA上でVHDLを用いて、クラスタサイズを変更して論理リソース使用量を評価できるように、MOAs用のシリアルライザー/アキュムレータペアを設計・合成する。
- リソース比較のベースラインとして、8ビットオペランドを用い、Quartus 16.0の合成ツールを用いてバイナリアダッタツリーを実装する。
- MOAツリー内の正確なバイナリアダッタを、近似比(0%〜50%)とビット幅を変更して、近似LOAアダッタに置き換える。
- 適応論理モジュール(ALMs)における論理リソース使用量を測定し、平均相対誤差距離(MRED)指標を用いて精度を評価する。
- 異なる近似比とビット幅におけるリソース使用量と誤差率を比較し、精度と面積効率のトレードオフを評価する。
- FPGA固有の論理ブロック(例:ハードウェアで統合されたフルアダッタを備えたALMs)が、近似アダッタの有効性に与える影響を分析する。
実験結果
リサーチクエスチョン
- RQ1時間多重シリアル化によるMOAsは、FPGAベースのCNNアクセラレータにおけるリソース使用量を低減するか?
- RQ2LOAアダッタを用いた近似計算により、FPGAにおけるMOAツリーの面積フットプリントを顕著に縮小できるか?
- RQ3なぜ両方の戦略(シリアル化と近似計算)が、現代のFPGAに実装された際に期待されたリソース削減を達成できないのか?
- RQ4現代のFPGA論理ブロックの構造(例:埋め込みフルアダッタを備えたALMs)は、MOA最適化に向けた近似アダッタの実用性にどのように影響するか?
- RQ5シリアルライザーのオーバーヘッドと固定された論理ブロック構造は、MOA最適化技術の理論的利点をどれほど相殺するのか?
主な発見
- MOAs用のシリアルライザー/アキュムレータペアは、完全にパイプライン化されたバイナリアダッタツリーと比較して、より多くの論理素子を消費する。また、オペランド数が増えるに従い、シリアルライザーのオーバーヘッドは線形に増加する。
- 近似LOAアダッタは、現代のFPGAではALM使用量を削減しない。論理ブロック自体がハードウェアで統合されたフルアダッタを備えているため、ORゲートベースの近似はハードウェアレベルで効果を発揮しない。
- 8ビットLOAアダッタの平均相対誤差距離(MRED)は、近似比が50%に達しても10%未満で推移し、一部の応用では許容可能な精度を示している。
- 低誤差率であるにもかかわらず、近似アダッタでは近似比に関係なくFPGA論理ブロックの固定リソースコストのため、面積の削減は得られない。
- MOAsの高いリソースコスト(AlexNetの最初の層で合計論理の最大69%を占める)は、現在のFPGA最適化戦略ではほとんど避けられない。
- 現在のFPGAアーキテクチャは、シリアル化や近似計算による効率的なMOA最適化をサポートしていない。大規模アダッタ用の専用DSPブロックの導入が急務である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。