Skip to main content
QUICK REVIEW

[論文レビュー] Neural Network-Hardware Co-design for Scalable RRAM-based BNN Accelerators

Yulhwa Kim, Hyungjun Kim|arXiv (Cornell University)|Nov 6, 2018
Advanced Neural Network Applications参考文献 13被引用数 15
ひとこと要約

本論文は、入力を分割し、BNNを再訓練することで1RRAMアレイごとに1ビット出力を計算するようにすることで、スケーラブルで1ビットアナログデジタルインターフェースを備えたRRAMベースのBNNアクセラレータを実現するニューラルネットワーク・ハードウェア共同設計フレームワークを提案する。この手法により、高分解能ADCを完全に排除し、CIFAR-10で1.1%未満の精度損失を達成するとともに、4ビットADCを用いた先行研究と比較して消費電力を最大93.3%まで削減した。

ABSTRACT

Recently, RRAM-based Binary Neural Network (BNN) hardware has been gaining interests as it requires 1-bit sense-amp only and eliminates the need for high-resolution ADC and DAC. However, RRAM-based BNN hardware still requires high-resolution ADC for partial sum calculation to implement large-scale neural network using multiple memory arrays. We propose a neural network-hardware co-design approach to split input to fit each split network on a RRAM array so that the reconstructed BNNs calculate 1-bit output neuron in each array. As a result, ADC can be completely eliminated from the design even for large-scale neural network. Simulation results show that the proposed network reconstruction and retraining recovers the inference accuracy of the original BNN. The accuracy loss of the proposed scheme in the CIFAR-10 testcase was less than 1.1% compared to the original network. The code for training and running proposed BNN models is available at: https://github.com/YulhwaKim/RRAMScalable_BNN.

研究の動機と目的

  • 大規模なネットワークにおける部分和計算に必要な高分解能ADCのため、RRAMベースのBNNアクセラレータのスケーラビリティと消費電力非効率性を是正すること。
  • 通常、RRAMアレイは最大約1,000行までしかサポートしないため、大規模な入力次元に対して完全な1ビットSA動作が実現できないという制限を克服すること。
  • 各RRAMアレイに1ビットセンスアンプを活用できるように、BNNを再構築・再訓練し、1アレイごとに1ビット出力を計算する仕組みを実現すること。
  • 推論精度を損なわず、複雑なモデル(CIFAR-10上のCNNなど)に対しても、消費電力効率とハードウェアのスケーラビリティを実現すること。

提案手法

  • BNNの入力特徴量を複数のパーティションに分割し、各パーティションが単一のRRAMアレイの行容量に収まるようにすること。
  • 各入力パーティションを別個のサブネットワークにマッピングすることで、それぞれが独自のRRAMアレイ上で1ビット出力ニューロンを計算するようにBNNアーキテクチャを再構築すること。
  • 合成シナプス重みと活性化をRRAMアレイに割り当てるパラメータマッピングを適用し、元のネットワークの機能的動作を保持すること。
  • 入力分割およびパラメータマッピングによる精度損失を回復するために、微調整手順を用いて再訓練された再構築BNNを適用すること。
  • フラッシュADCの消費電力スケーリング則(P ∝ α₂(2^N − 1))に基づく消費電力推定モデルを用いて、異なるADCビット解像度間での消費電力消費を比較すること。
  • 各アレイに1ビットSA機能を活用することで、大規模ネットワークに対しても高分解能ADCの必要性を完全に排除すること。

実験結果

リサーチクエスチョン

  • RQ1入力分割とBNNの再訓練により、1RRAMアレイごとに1ビット出力を計算することが可能となり、大規模なBNNにおいて高分解能ADCの必要性が排除できるか?
  • RQ21ビットADCのみを用いた場合、提案手法による共同設計BNNの精度低下はどの程度か?
  • RQ3提案手法のRRAMベースBNNアクセラレータの消費電力は、3ビットまたは4ビットADCを用いた先行研究と比較してどの程度か?
  • RQ4CIFAR-10におけるCNNのような大規模なBNNにおいて、入力分割およびパラメータマッピング後の再訓練が、どの程度精度を回復できるか?
  • RQ5提案手法は、1ビットSAおよびメモリ内演算といったRRAMベースBNNアクセラレータの利点を維持しながら、大規模ネットワークへのスケーリングを可能にするか?

主な発見

  • 入力分割および再訓練後でも、CIFAR-10データセットにおいて、元のBNNと比較して1.1%未満の精度損失に抑えられた。
  • MNIST MLPでは、パラメータマッピングのみで再構築BNNとベースラインBNNとの精度差を0.5%未満に抑えられ、さらに再訓練により精度が向上した。
  • 提案手法の1ビットADC設計の消費電力は、4ビットADCを用いるBCNN-RRAMと比較して93.3%削減され、3ビットADCを用いるXNOR-RRAMと比較しても85.7%削減された。
  • 高分解能ADCの排除により、提案アクセラレータの総消費電力はBCNN-RRAMと比較して60.7%低く、XNOR-RRAMと比較しても39.9%低くなった。
  • 本手法により、各RRAMアレイの1ビットセンスアンプが完全に活用可能となり、RRAMベースBNNアクセラレータのエネルギー効率とスケーラビリティが維持された。
  • 再構築および再訓練プロセスにより、1アレイごとの1ビット出力計算が正常に維持され、大規模ネットワークにおいてもADCの完全な排除が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。