Skip to main content
QUICK REVIEW

[論文レビュー] TinBiNN: Tiny Binarized Neural Network Overlay in about 5,000 4-LUTs and 5mW

Guy Lemieux, Joe Edwards|arXiv (Cornell University)|Mar 5, 2019
Advanced Neural Network Applications被引用数 5
ひとこと要約

TinBiNNは、1ビット重みと8ビット活性化を用いて、バイナリゼートドニューラルネットワークの推論を高速化する、5,000 LUT、5mWのFPGAベースのハードウェアオーバーレイを提示する。CIFAR-10で10カテゴリ分類器として1,315msで13.6%の誤差を達成し、1カテゴリの顔検出器として195msで0.4%の誤差を達成する。1ビット重みと8ビット固定小数点演算を用いたカスタムRISC-Vベクタープロセッサと専用CNN加速により、超低消費電力かつ低面積効率を実現した。

ABSTRACT

Reduced-precision arithmetic improves the size, cost, power and performance of neural networks in digital logic. In convolutional neural networks, the use of 1b weights can achieve state-of-the-art error rates while eliminating multiplication, reducing storage and improving power efficiency. The BinaryConnect binary-weighted system, for example, achieves 9.9% error using floating-point activations on the CIFAR-10 dataset. In this paper, we introduce TinBiNN, a lightweight vector processor overlay for accelerating inference computations with 1b weights and 8b activations. The overlay is very small -- it uses about 5,000 4-input LUTs and fits into a low cost iCE40 UltraPlus FPGA from Lattice Semiconductor. To show this can be useful, we build two embedded 'person detector' systems by shrinking the original BinaryConnect network. The first is a 10-category classifier with a 89% smaller network that runs in 1,315ms and achieves 13.6% error. The other is a 1-category classifier that is even smaller, runs in 195ms, and has only 0.4% error. In both classifiers, the error can be attributed entirely to training and not reduced precision.

研究の動機と目的

  • リソース制限のあるFPGA上で、最小限の低消費電力ハードウェアアクセラレータを設計すること。
  • 1ビット重みと8ビット固定小数点活性化を用いて、ネットワークサイズと精度を低減しながらも高い精度を維持すること。
  • カスタムRISC-Vプロセッサに軽量ベクターエクステンション(LVE)と専用CNN加速を組み合わせることで、高い性能とエネルギー効率を達成すること。
  • 最小限のハードウェアと消費電力で、人物検出などの実用的な組み込みビジョン応用を実現すること。
  • 固定小数点演算を用いても高い精度を維持できることから、バイナリゼートドネットワークの誤差低下は主にトレーニングの制限によるものであり、精度低下とは無関係であることを示すこと。

提案手法

  • 89%の演算削減(2×128C3から2×48C3に)を実現した変更版BinaryConnectネットワークを採用し、活性化には8ビット符号なし整数、中間和には16/32ビット符号あり整数を用いる。
  • 1サイクルあたり32ビットオペランドをフェッチし、2つの重複する3×3畳み込みを並列に計算するカスタムハードウェアアクセラレータを採用。1入力列あたり2パスを実行し、4つの出力を生成する。
  • パイプライン化されたRISC-V ORCAプロセッサに軽量ベクターエクステンション(LVE)を統合したTinBiNNオーバーレイにより、ループやアドレス生成のオーバーヘッドなしに効率的なベクターや行列演算が可能になる。
  • LVEパイプラインにカスタムALU命令を追加:16ビットから32ビットへのSIMD加算、および32ビットから8ビットへの活性化関数。これにより、オーバーフローに安全な累積と8ビット出力生成が可能になる。
  • DMAエンジンがSPIフラッシュROMから重み、VGAカメラから画像データを128kBスクラッチパッドにストリーム送信し、ハードウェアによるスケーリングとデインタリーブ処理により、40×30ピクセル入力処理を実現する。
  • 畳み込み処理には32×32の中央領域を用い、32ビットアラインドのチャンクに分割して処理し、パス間でアラインメントを維持する。

実験結果

リサーチクエスチョン

  • RQ11ビット重みと8ビット活性化を用いたバイナリゼートドニューラルネットワークが、FPGA上で5,000 LUTと5mWの消費電力制限内に収まりながら高い精度を達成できるか。
  • RQ2固定小数点演算とバイナリゼートド重みを用いる場合、ネットワークサイズをどれほど削減しても顕著な精度損失が生じないか。
  • RQ3専用命令を備えたカスタムRISC-Vベクタープロセッサは、ソフトウェアオンリー実行に比べて、バイナリゼートドCNN推論をどれほど効果的に高速化できるか。
  • RQ4超低消費電力の組み込みシステムが、最小限のハードウェアと固定小数点演算でリアルタイムの人物検出を実現できるか。
  • RQ5バイナリゼートドネットワークで観察される誤差は、主にトレーニングの制限によるものであり、精度低下とは無関係であるか。

主な発見

  • 10カテゴリ分類器は、元のBinaryConnectネットワークに比べ89%の演算削減を実現し、1ビット重み表現による精度損失なしにCIFAR-10で13.6%の誤差を達成した。
  • 1カテゴリの顔検出器は、iCE40 UltraPlus FPGA上で195msの推論時間で0.4%の誤差を達成し、消費電力は21.8 mW、1フレーム/秒では4.6 mWにまで低下した。
  • ハードウェアアクセラレータにより、ソフトウェアオンリー実行のORCA RISC-Vコアに比べ、畳み込み層の実行時間が73倍高速化された。
  • LVE拡張により、密度の高い層の性能が8倍向上し、結果として純ソフトウェア実行に比べ71倍の全体的な高速化が達成された。
  • システムは5,280個の4-LUTのうち4,895個、8個のDSPブロックのうち4個を消費しており、5,000 LUTと5mWのiCE40 UltraPlus-5K FPGAに収容可能である。
  • 10カテゴリ分類器の誤差は、固定小数点演算でも浮動小数点と同一の13.6%誤差率を維持しており、誤差の原因は主にトレーニングに起因するものであることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。