Skip to main content
QUICK REVIEW

[論文レビュー] Analyzing and Mitigating the Impact of Permanent Faults on a Systolic Array Based Neural Network Accelerator

Jeff Zhang, Tianyu Gu|arXiv (Cornell University)|Feb 11, 2018
Parallel Computing and Optimization Techniques参考文献 8被引用数 14
ひとこと要約

本稿では、TPUのようなステイティックアレイベースのDNNアクセラレータが最大50%の恒久的故障を許容しつつ、最小限の精度損失で動作可能にするため、故障に強いプリューニング(FAP)および再訓練を伴う故障に強いプリューニング(FAP+T)を提案する。FAP+Tは一回の再訓練により精度を回復させ、1チップあたりのペナルティを12分未塔に抑え、実行時オーバーヘッドは一切発生しない。

ABSTRACT

Due to their growing popularity and computational cost, deep neural networks (DNNs) are being targeted for hardware acceleration. A popular architecture for DNN acceleration, adopted by the Google Tensor Processing Unit (TPU), utilizes a systolic array based matrix multiplication unit at its core. This paper deals with the design of fault-tolerant, systolic array based DNN accelerators for high defect rate technologies. To this end, we empirically show that the classification accuracy of a baseline TPU drops significantly even at extremely low fault rates (as low as $0.006\%$). We then propose two novel strategies, fault-aware pruning (FAP) and fault-aware pruning+retraining (FAP+T), that enable the TPU to operate at fault rates of up to $50\%$, with negligible drop in classification accuracy (as low as $0.1\%$) and no run-time performance overhead. The FAP+T does introduce a one-time retraining penalty per TPU chip before it is deployed, but we propose optimizations that reduce this one-time penalty to under 12 minutes. The penalty is then amortized over the entire lifetime of the TPU's operation.

研究の動機と目的

  • ステイティックアレイベースのDNNアクセラレータが恒久的故障に対してどれほど脆弱であるかを調査すること。
  • 将来の半導体技術における高い欠陥レートの課題に対処すること。
  • 故障したMACユニットが存在しても高い分類精度を維持できる耐故障DNNアクセラレータを設計すること。
  • 高い故障耐性を実現しつつ、実行時パフォーマンスオーバーヘッドを最小限に抑えること。
  • 故障に強い再訓練のための一回限りの再訓練コストを1チップあたり12分未塔に削減すること。

提案手法

  • TPUクラスのステイティックアレイに対するステッブアット故障挿入を伴うゲートレベルシミュレーションを用いて、故障の影響を評価する。
  • 故障したMACユニットの接続をすべてプリューニングすることで、それらをバイパスする故障に強いプリューニング(FAP)を導入する。
  • FAPと再訓練を組み合わせたFAP+Tを提案し、プリューニング後の分類精度を回復させる。
  • 故障したMACを避けるための故障に強い再マッピングを含むスケジューリングポリシーを用いる。
  • 訓練エポック数を制限することで再訓練を最適化し、1回のコストを削減し、AlexNetでは5倍の高速化を達成する。
  • 45nm CMOSで合成された256×256のステイティックアレイを用い、658 MHzで動作し、19.7Wの動的消費電力を有する。

実験結果

リサーチクエスチョン

  • RQ1低故障率におけるTPUに類似したステイティックアレイアクセラレータの恒久的故障に対する脆弱性はいかほどか?
  • RQ2MACユニットの顕著な割合が恒久的に故障している場合でも、DNNが高い分類精度を維持できるか?
  • RQ3実行時パフォーマンスオーバーヘッドを発生させずに、ステイティックアレイアクセラレータで故障耐性を実現できる技術は何か?
  • RQ4故障に強い再訓練の一回限りの再訓練コストを実用的な水準にまで低減できるか?
  • RQ5単純なプリューニングと比較して、再訓練を伴う故障に強いプリューニングは、精度と効率の面でどのように優れているか?

主な発見

  • 0.006%の故障率ですでに分類精度が急激に低下し、4つの故障したMACユニットが顕著な劣化を引き起こす。
  • FAPはMNISTおよびTIMITにおいて25%までの故障率でベースラインに近い精度を維持するが、50%で劣化を示す。
  • FAP+Tは50%の故障率でもベースラインに近い精度を達成し、TIMITでは0.1%の精度低下、AlexNetでは8%の精度低下にとどまる。
  • AlexNetの1回限りの再訓練オーバーヘッドは、訓練エポック数を25から5に制限することで、約1時間から12分未塔に削減された。
  • FAP+Tは実行時パフォーマンスオーバーヘッドを一切発生せず、再訓練コストはTPUの寿命にわたって均等に分散される。
  • 提案手法は、完全結合型および畳み込み型DNNの両方に対して有効であるが、スケジューリングポリシーがCNNのパフォーマンスに影響を及ぼす。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。