Skip to main content
QUICK REVIEW

[論文レビュー] Training large-scale ANNs on simulated resistive crossbar arrays

Malte J. Rasch, Tayfun Gokmen|arXiv (Cornell University)|Jun 6, 2019
Advanced Memory and Neural Computing参考文献 18被引用数 4
ひとこと要約

本論文は、アルゴリズム的手法による補正——特に正規化と重み範囲の再マッピング——を用いることで、重み解像度の制限やアナログノイズといったハードウェア制約があるにもかかわらず、AlexNetのような大規模なANNをシミュレーテッド抵抗性クロスバー配列上で効果的に学習できることを示している。主な貢献は、12,000の有効デバイス状態のみを用いて、トップ-1テスト誤差を20パcentポイント改善し、約60%まで低下させたことであり、これらの手法が浮動小数点学習との精度ギャップを顕著に縮小することを示している。

ABSTRACT

Accelerating training of artificial neural networks (ANN) with analog resistive crossbar arrays is a promising idea. While the concept has been verified on very small ANNs and toy data sets (such as MNIST), more realistically sized ANNs and datasets have not yet been tackled. However, it is to be expected that device materials and hardware design constraints, such as noisy computations, finite number of resistive states of the device materials, saturating weight and activation ranges, and limited precision of analog-to-digital converters, will cause significant challenges to the successful training of state-of-the-art ANNs. By using analog hardware aware ANN training simulations, we here explore a number of simple algorithmic compensatory measures to cope with analog noise and limited weight and output ranges and resolutions, that dramatically improve the simulated training performances on RPU arrays on intermediately to large-scale ANNs.

研究の動機と目的

  • ハードウェア制約(例:制限された重み解像度、アナログノイズ)を伴うシミュレーテッド抵抗性プロセッシングユニット(RPU)配列を用いて、ImageNet上の大規模なANN(例:AlexNet)を学習する可能性を調査すること。
  • アナログノイズ、制限された重み解像度、および制限されたダイナミックレンジが学習性能に与える影響を評価すること。
  • これらの制約下で精度を向上させるための単純なアルゴリズム的補正措置を同定および実装すること。
  • 大規模な学習において浮動小数点精度に近づくために必要な最小限の有効デバイス状態数を特定すること。

提案手法

  • GPUアクセラレーションを備えたCaffe2統合RPUシミュレータを用いて、抵抗性クロスバー配列上で大規模なANN(例:AlexNet)のシミュレーテッド学習を実施した。
  • 最大長31の確率的パルストレインを用いてアナログハードウェア更新を模擬するパルス型重み更新を採用した。
  • 前方伝搬および逆誤差伝搬の両過程でアナログノイズの影響を軽減するために、活性化値のzスコア正規化を適用した。
  • 有効な抵抗状態数を仮想的に拡張し、正則化を向上させるために、新規の重み再マッピング方式を実装した。
  • 最小重み変化Δw_min = 0.001のベースラインRPUモデル(1,200有効状態)を用い、アブレーション実験のために12,000状態までスケーリングした。
  • バッチサイズ25、正則化係数λ = 0.00125、15エポックごとに学習率を減衰させる設定でImageNet上で性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1ImageNet上でAlexNetのような大規模なANNをアナログRPU配列で学習するのに、必要な有効抵抗状態数はどれくらいか?
  • RQ2正規化手法は、RPUベースの学習における逆誤差伝搬段階でのアナログノイズの影響を効果的に低減できるか?
  • RQ3重み範囲の仮想的再マッピングは、低精度RPU配列における有効解像度および一般化性能を向上させるか?
  • RQ4アルゴリズム的補正は、アナログRPU学習と浮動小数点基準モデルとの間の精度ギャップをどの程度縮小できるか?
  • RQ5正規化と再マッピングによる性能向上は、現在のハードウェア制約下でも最先端の精度に到達するのに十分か?

主な発見

  • 1,200の有効デバイス状態でのみ、ImageNetにおけるトップ-1テスト誤差は約80%に達し、解像度の制限による顕著な性能劣化が確認された。
  • 活性化値のzスコア正規化を適用することで、アナログノイズの影響が軽減され、より大きなモデルでの収束が可能になった。
  • 重み範囲の再マッピングを導入したことで、トップ-1テスト誤差が約20パーセントポイント改善され、12,000有効状態で約60%の誤差にまで低下した。
  • 12,000状態と完全なアルゴリズム的補正を適用しても、浮動小数点基準モデルの50%未満のトップ-1誤差に到達できなかった。
  • 再マッピングによる性能向上は、AlexNet(最大行列次元9216)のような深層ネットワークでは、CIFAR上の浅層ネットワーク(例:ResNet)よりも顕著に現れた。
  • 結果から、アルゴリズム的補正によりアナログ学習の性能は顕著に向上するが、浮動小数点精度に完全に到達するには、材料技術やシステム設計におけるさらなるイノベーションが必要であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。