Skip to main content
QUICK REVIEW

[論文レビュー] Faster Neural Network Training with Approximate Tensor Operations

Menachem Adelman, Kfir Y. Levy|arXiv (Cornell University)|May 21, 2018
Advanced Neural Network Applications参考文献 57被引用数 9
ひとこと要約

本稿では、行列乗算や畳み込みなどのテンソル演算にサンプルベースの近似を適用することで、深層ニューラルネットワークの学習を高速化する新しい手法を提案する。Top-k-CRS や Bernoulli-CRS といった効率的なサンプリング手法を用いることで、計算量と通信量を最大66%まで削減し、MNIST、CIFAR-10、ImageNet のベンチマークにおいて最小限の精度損失で最大1.37倍の高速化を達成する。

ABSTRACT

We propose a novel technique for faster deep neural network training which systematically applies sample-based approximation to the constituent tensor operations, i.e., matrix multiplications and convolutions. We introduce new sampling techniques, study their theoretical properties, and prove that they provide the same convergence guarantees when applied to SGD training. We apply approximate tensor operations to single and multi-node training of MLP and CNN networks on MNIST, CIFAR-10 and ImageNet datasets. We demonstrate up to 66% reduction in the amount of computations and communication, and up to 1.37x faster training time while maintaining negligible or no impact on the final test accuracy.

研究の動機と目的

  • モデルの精度を損なわせることなく、より高速な深層ニューラルネットワーク学習のニーズに対応する。
  • 単一ノードおよびマルチノード学習におけるテンソル演算へのサンプリングベースの近似の適用を体系的に行う。
  • 分散環境における学習時間と通信帯域幅の実用的向上を実現する。
  • 近似演算を用いる場合の確率的勾配降下法(SGD)の理論的収束保証を確保する。
  • 既存のディープラーニングフレームワークと標準的な通信プリミティブ(例:AllReduce)と互換性を持つサンプリング手法を開発する。

提案手法

  • 前向きおよび逆向きの伝搬における行列乗算の近似に、列-行サンプリング(CRS)およびその変種(Bernoulli-CRS、Top-k-CRS)を適用する。
  • Top-k-CRS を用いて、ノルムが最大の列-行ペアを決定的に選択し、ペアワイズ独立性の下で平均二乗誤差を最小化する。
  • 近似誤差解析に基づく最適なサンプリング方策を導出し、多チャンネル畳み込みへのアプローチを一般化する。
  • ネットワークアーキテクチャおよびテンソル次元を保持したまま、PyTorch に近似を統合する。
  • データ並列分散学習における帯域幅削減を実現するため、スパースなサンプリングを活用した勾配通信スキームを設計する。
  • サンプル化された勾配成分のみを送信することで、標準的な AllReduce と互換性を維持する。

実験結果

リサーチクエスチョン

  • RQ1精度の著しい低下を伴わずに、近似テンソル演算を用いて深層ニューラルネットワークを効果的に学習できるか?
  • RQ2近似された行列乗算および畳み込みを用いた場合のSGDの理論的収束特性は何か?
  • RQ3異なるサンプリング戦略(例:Bernoulli-CRS 対 Top-k-CRS)は、学習の安定性および最終的なモデル精度にどのように影響するか?
  • RQ4分散学習において、近似が計算量と通信量をどの程度削減できるか、収束性を保持したまま?
  • RQ5提案手法は、既存のディープラーニングフレームワークおよび学習パイプラインにシームレスに統合可能か?

主な発見

  • Top-k-CRS アルゴリズムは、評価されたすべてのデータセットで最高のテスト精度を達成し、Bernoulli-CRS や他のサンプリング戦略を上回った。
  • WRN-28-10 を用いたCIFAR-10 では、前向き伝搬で90%のサンプリングを実施しても、ベースラインから1%以内の精度損失に抑えられ、学習が1.33倍高速化された。
  • ImageNet におけるResNet-50 では、1024チャンネル以上の層(全FLOPsの93%)に対して50%のサンプリングを適用しても、完全精度ベースラインと同一のトップ1精度を達成した。
  • ResNet-152 では、1024チャンネル以上の層(全FLOPsの91%)に対して50%のサンプリングを適用しても、トップ1精度がベースラインから0.5%以内の範囲に保たれた。
  • マルチノード分散学習では、サンプル化された勾配を用いたAllReduceを適用することで、通信帯域幅を削減し、最大1.37倍の高速化を達成した。
  • 理論的分析により、重みが有界で、活性化関数が有界である条件下で、提案された近似がSGDの収束保証を維持することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。