Skip to main content
QUICK REVIEW

[論文レビュー] Arithmetic-Intensity-Guided Fault Tolerance for Neural Network Inference on GPUs

Jack Kosaian, K. V. Rashmi|arXiv (Cornell University)|Apr 19, 2021
Advanced Neural Network Applications参考文献 69被引用数 43
ひとこと要約

本論文は、各層の算術強度に基づいて、従来のアルゴリズムベースの故障耐性(ABFT)とスレッドレベルのABFTの間で動的に切り替える、強度誘導型ABFTを提案する。これは、帯域幅制限の層で未利用の計算リソースを活用することで、多様なモデルにおいて実行時間のオーバーヘッドを1.09–5.3倍まで低減し、静的ABFT手法に比べて大幅に効率性を向上させるGPU上でのニューラルネットワーク推論のための適応的故障耐性フレームワークである。

ABSTRACT

Neural networks (NNs) are increasingly employed in safety-critical domains and in environments prone to unreliability (e.g., soft errors), such as on spacecraft. Therefore, it is critical to impart fault tolerance to NN inference. Algorithm-based fault tolerance (ABFT) is emerging as an efficient approach for fault tolerance in NNs. We propose an adaptive approach to ABFT for NN inference that exploits untapped opportunities in emerging deployment scenarios. GPUs have high compute-to-memory-bandwidth ratios, while NN layers have a wide range of arithmetic intensities. This leaves some layers compute bound and others memory-bandwidth bound, but current approaches to ABFT do not consider these differences. We first investigate ABFT schemes best suited for each of these scenarios. We then propose intensity-guided ABFT, an adaptive, arithmetic-intensity-guided approach that selects the most efficient ABFT scheme for each NN layer. Intensity-guided ABFT reduces execution-time overhead by 1.09--5.3$ imes$ across many NNs compared to traditional approaches to ABFT.

研究の動機と目的

  • 安全性が求められるニューラルネットワークの導入において、特に高高度および宇宙環境でのソフトエラーの増加する課題に対処すること。
  • 既存のABFTアプローチがすべての線形層を計算制限と仮定しているが、現代のGPU最適化推論においてリソースのボトルネックを無視しているという非効率性を克服すること。
  • 低算術強度のニューラルネットワーク層に一般的に見られる帯域幅制限の層における未利用の計算サイクルを活用し、スレッドレベルのABFT方式を導入することで、効率的な冗長実行を実現すること。
  • 算術強度に基づいて各層ごとに適応的かつ最適なABFT戦略を選択することで、実行時間のオーバーヘッドを最小限に抑えつつ、故障検出を保証する戦略を設計すること。

提案手法

  • 現代の推論最適化GPUの計算対メモリ帯域幅比(CMR)を分析し、低算術強度のため多くのニューラルネットワーク層がメモリ帯域幅制限であることを特定する。
  • GPUスレッドレベルでチェックサム計算を実行するスレッドレベルのABFT方式を提案する。これにより、スレッド間通信が不要となり、帯域幅制限の層と競合する追加のメモリアクセスが回避される。
  • 算術強度に基づいて各線形層を計算制限または帯域幅制限と分類し、それに応じて最も効率的なABFT方式を選択する、適応的フレームワーク「強度誘導型ABFT」を導入する。
  • ハイブリッドABFT戦略を採用:計算制限の層には従来のABFT、帯域幅制限の層にはスレッドレベルのABFTを用い、両者を同じ推論パイプラインに統合する。
  • 浮動小数点演算数とメモリトラフィックのバイト数の比を算術強度の指標として用い、方式選択をガイドする。
  • 複数のニューラルネットワーク(例:ResNet、EfficientNet、MobileNet)を、異なるGPUアーキテクチャ上で評価し、実行時間のオーバーヘッドと故障検出カバレッジを測定する。

実験結果

リサーチクエスチョン

  • RQ1GPU上の帯域幅制限のニューラルネットワーク層における未利用の計算リソースを、故障耐性における効率的な冗長実行に活用できるか?
  • RQ2算術強度が異なる層において、ABFT方式の選択(従来方式対スレッドレベル方式)が実行時間のオーバーヘッドに与える影響は何か?
  • RQ3算術強度に依存した適応的ABFT方式選択は、静的かつ一様なABFTアプローチに比べ、パフォーマンスと故障カバレッジの両面で優れているか?
  • RQ4スレッドレベルABFTは、追加のメモリトラフィックを発生させずに、帯域幅制限のシナリオで従来のABFTに比べてどの程度オーバーヘッドを低減できるか?

主な発見

  • 強度誘導型ABFTは、複数のニューラルネットワークにおいて従来のABFT手法に比べ、実行時間のオーバーヘッドを1.09–5.3倍まで低減した。
  • 提案されたスレッドレベルABFT方式は、追加のメモリトラフィックをゼロに保ちながら故障検出を達成しており、帯域幅制限の層に最適である。
  • フレームワークは、算術強度をガイドとして用いることで、層を計算制限または帯域幅制限に的確に分類し、各層に最適なABFT方式選択を可能にした。
  • 現代の効率的なニューラルネットワークアーキテクチャに一般的に見られる帯域幅制限の層は、最小限のパフォーマンスコストで冗長計算の機会を秘めている。
  • 適応的選択戦略は、層の特性が異なる混合ワークロードにおいて、静的ABFTおよびレプリケーションベースのアプローチを上回る性能を示した。
  • このアプローチはニューラルネットワークに限らず汎用的であり、一般の行列乗算を保護できるため、GPUアクセラレータを対象とするより広範なHPCワークロードへも応用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。