Skip to main content
QUICK REVIEW

[論文レビュー] Exploiting the Tradeoff between Program Accuracy and Soft-error Resiliency Overhead for Machine Learning Workloads

Qingchuan Shi, Hamza Omar|arXiv (Cornell University)|Jul 9, 2017
Radiation Effects in Electronics参考文献 12被引用数 7
ひとこと要約

本稿では、機械学習コードを正しさに影響する(重要)領域と正確性にのみ影響する(非重要)領域に分類し、重要領域には強力なハードウェア冗長実行(HaRE)を、非重要領域には軽量なソフトウェア・ハードウェアレジリエンス(SHR)を適用するクロスレイヤーレジリエンスアーキテクチャを提案する。非レジリエント実行と比較してわずか~1.1×のオーバーヘッドで、ソフトエラーのカバレッジを維持しつつ、HaREと比較して平均32%の性能向上を達成する。

ABSTRACT

To protect multicores from soft-error perturbations, resiliency schemes have been developed with high coverage but high power and performance overheads. Emerging safety-critical machine learning applications are increasingly being deployed on these platforms. Moreover, these systems are exposed to harsh environments, such as unmanned aerial vehicles (UAVs) and self-driving cars. Due to the unique structure and computational behavior of such applications, research has been done on relaxing their accuracy for performance benefits. We observe that not all transient errors affect program correctness, some errors only affect program accuracy, i.e., the program completes with certain acceptable deviations from error free outcome. This paper illustrates the idea of cross-layer soft-error resilience using machine learning workloads, where program accuracy is introduced as a tradeoff to deliver resilient yet efficient execution on futuristic large-scale multicores.

研究の動機と目的

  • UAV や自動運転車などの過酷な環境に展開された安全に重要な機械学習システムにおけるソフトエラーの増加する課題に対処すること。
  • マルチコアシステムにおける既存のソフトエラー耐性機構の高い性能および電力オーバーヘッドを低減すること。
  • ソフトエラーのカバレッジやプログラムの正しさを損なわせることなく、プログラムの正確性とレジリエンスのオーバーヘッドのトレードオフを検討すること。
  • コード領域のプログラム結果への影響に基づいて分類することで、機械学習ワークロードの効率的でレジリエントな実行を可能にすること。

提案手法

  • プログラムの結果に与える影響に基づいて、コード領域を正しさに影響する(重要)領域と正確性にのみ影響する(非重要)領域に分類する。
  • ソフトエラー下でも正しさを保証するため、重要領域にハードウェア冗長実行(HaRE)を適用する。
  • 性能オーバーヘッドを最小限に抑えるために、非重要領域に軽量なソフトウェア・ハードウェアレジリエンス(SHR)スキームを適用する。
  • ハードウェアとソフトウェアを統合するクロスレイヤーアーキテクチャを採用し、コード領域ごとに動的にレジリエンス戦略を選択する。
  • 環境中のエラー率と許容可能な正確性損失のしきい値に基づいて、レジリエンスを調整する設定選択メカニズムを採用する。
  • さまざまなエラー率と正確性のしきい値の下で、複数の機械学習ベンチマーク(例:CNN-ALEXNET、MLP-MNIST)上でアプローチを評価する。

実験結果

リサーチクエスチョン

  • RQ1機械学習ワークロードにおける非重要コード領域は、プログラムの正しさを損なわせることなく、軽量な耐性スキームで保護可能か?
  • RQ2重要領域にのみ強力な耐性を適用することで、性能オーバーヘッドをどの程度低減できるか?
  • RQ3異なる機械学習ベンチマークおよびエラー率において、正確性損失と性能向上のトレードオフはどのように変化するか?
  • RQ4与えられた正確性のしきい値と環境中のエラー条件のもとで、どのコード領域の設定が最適な性能向上をもたらすか?

主な発見

  • 提案されたクロスレイヤーレジリエンス(CL)アーキテクチャは、非レジリエント実行と比較して、平均的な性能オーバーヘッドを約1.63×から約1.1×に削減した。
  • CLは、評価された機械学習ベンチマーク全体でHaREと比較して平均32%の性能向上を達成した。
  • 0.1%のエラー率および10%の正確性しきい値の下で、CNN-ALEXNETは実行時間の91%を非重要領域と分類することで、37%の性能向上を達成した。
  • エラー率が0.5%に上昇すると、正確性を維持するためにより多くのコード領域を重要領域と分類する必要が生じ、性能向上は26%に低下した。
  • 出力層を非重要領域と定義すると、0.1%のエラー率でもすべてのベンチマークで10%以上の正確性損失が生じ、その感受性が顕著に現れた。
  • 戦略的な耐性パーティショニングにより、ソフトエラーのカバレッジを維持するとともに、プログラムの正しさを保証しつつ、顕著な性能向上を実現できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。