Skip to main content
QUICK REVIEW

[論文レビュー] The Challenge of Multi-Operand Adders in CNNs on FPGAs: How not to solve it!

Kamel Abdelouahab, François Berry|arXiv (Cornell University)|Jun 30, 2018
Advanced Memory and Neural Computing参考文献 15被引用数 4
ひとこと要約

本稿では、FPGAベースのCNNアクセラレータにおけるマルチオペランドアダッタ(MOAs)の高いリソースコストを低減するための2つの戦略——時間多重シリアル化とLOAアダッタを用いた近似計算——を検討する。理論的には有望であるが、実際には両者とも失敗する:シリアル化は過剰な論理回路オーバーヘッドを引き起こし、近似アダッタはFPGAの論理ブロックアーキテクチャのため面積の削減が得られず、結果として現在のFPGAではこれらの手法によるMOA最適化が不適切であることが示された。

ABSTRACT

Convolutional Neural Networks (CNNs) are computationally intensive algorithms that currently require dedicated hardware to be executed. In the case of FPGA-Based accelerators, we point-out in this work the challenge of Multi-Operand Adders (MOAs) and their high resource utilization in an FPGA implementation of a CNN. To address this challenge, two optimization strategies, that rely on time-multiplexing and approximate computing, are investigated. At first glance, the two strategies looked promising to reduce the footprint of a given architectural mapping, but when synthesized on the device, none of them gave the expected results. Experimental sections analyze the reasons of these unexpected results.

研究の動機と目的

  • FPGAベースのCNNアクセラレータにおけるマルチオペランドアダッタ(MOAs)の高いリソース使用量を解決すること。MOAは一部の層で論理リソースの最大69%を消費する。
  • 時間多重シリアル化を用いて、複数のクロックサイクルにわたるアダッタハードウェアの再利用により、MOAのフットプリントを縮小する手法を評価すること。
  • 下位ビットOR(LOA)アダッタを用いた近似計算を活用し、MOAツリーにおける面積と消費電力の削減を検討すること。
  • これらの最適化戦略が、現代のFPGAに合成された際になぜ期待されたリソース削減を達成できないかを特定すること。理論的期待に反して失敗する理由を明らかにすること。

提案手法

  • Intel Stratix V FPGA上でVHDLを用いて、クラスタサイズを変更して論理リソース使用量を評価できるように、MOAs用のシリアルライザー/アキュムレータペアを設計・合成する。
  • リソース比較のベースラインとして、8ビットオペランドを用い、Quartus 16.0の合成ツールを用いてバイナリアダッタツリーを実装する。
  • MOAツリー内の正確なバイナリアダッタを、近似比(0%〜50%)とビット幅を変更して、近似LOAアダッタに置き換える。
  • 適応論理モジュール(ALMs)における論理リソース使用量を測定し、平均相対誤差距離(MRED)指標を用いて精度を評価する。
  • 異なる近似比とビット幅におけるリソース使用量と誤差率を比較し、精度と面積効率のトレードオフを評価する。
  • FPGA固有の論理ブロック(例:ハードウェアで統合されたフルアダッタを備えたALMs)が、近似アダッタの有効性に与える影響を分析する。

実験結果

リサーチクエスチョン

  • RQ1時間多重シリアル化によるMOAsは、FPGAベースのCNNアクセラレータにおけるリソース使用量を低減するか?
  • RQ2LOAアダッタを用いた近似計算により、FPGAにおけるMOAツリーの面積フットプリントを顕著に縮小できるか?
  • RQ3なぜ両方の戦略(シリアル化と近似計算)が、現代のFPGAに実装された際に期待されたリソース削減を達成できないのか?
  • RQ4現代のFPGA論理ブロックの構造(例:埋め込みフルアダッタを備えたALMs)は、MOA最適化に向けた近似アダッタの実用性にどのように影響するか?
  • RQ5シリアルライザーのオーバーヘッドと固定された論理ブロック構造は、MOA最適化技術の理論的利点をどれほど相殺するのか?

主な発見

  • MOAs用のシリアルライザー/アキュムレータペアは、完全にパイプライン化されたバイナリアダッタツリーと比較して、より多くの論理素子を消費する。また、オペランド数が増えるに従い、シリアルライザーのオーバーヘッドは線形に増加する。
  • 近似LOAアダッタは、現代のFPGAではALM使用量を削減しない。論理ブロック自体がハードウェアで統合されたフルアダッタを備えているため、ORゲートベースの近似はハードウェアレベルで効果を発揮しない。
  • 8ビットLOAアダッタの平均相対誤差距離(MRED)は、近似比が50%に達しても10%未満で推移し、一部の応用では許容可能な精度を示している。
  • 低誤差率であるにもかかわらず、近似アダッタでは近似比に関係なくFPGA論理ブロックの固定リソースコストのため、面積の削減は得られない。
  • MOAsの高いリソースコスト(AlexNetの最初の層で合計論理の最大69%を占める)は、現在のFPGA最適化戦略ではほとんど避けられない。
  • 現在のFPGAアーキテクチャは、シリアル化や近似計算による効率的なMOA最適化をサポートしていない。大規模アダッタ用の専用DSPブロックの導入が急務である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。