Skip to main content
QUICK REVIEW

[論文レビュー] Minimal Effort Back Propagation for Convolutional Neural Networks

Bingzhen Wei, Xu Sun|arXiv (Cornell University)|Sep 18, 2017
Advanced Neural Network Applications参考文献 14被引用数 20
ひとこと要約

本論文では、勾配の大きさに基づいて上位k個の勾配のみを後退伝播に使用するmeProp-CNNを提案する。わずか5%の勾配を使用しても、標準的なCNNと同等またはそれ以上の精度を達成し、過学習に対する耐性が向上し、モーメンタムやバッチ正規化などの最適化手法とも互換性がある。

ABSTRACT

As traditional neural network consumes a significant amount of computing resources during back propagation, \citet{Sun2017mePropSB} propose a simple yet effective technique to alleviate this problem. In this technique, only a small subset of the full gradients are computed to update the model parameters. In this paper we extend this technique into the Convolutional Neural Network(CNN) to reduce calculation in back propagation, and the surprising results verify its validity in CNN: only 5\% of the gradients are passed back but the model still achieves the same effect as the traditional CNN, or even better. We also show that the top-$k$ selection of gradients leads to a sparse calculation in back propagation, which may bring significant computational benefits for high computational complexity of convolution operation in CNN.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)におけるバックプロパゲーションの高コストな計算を軽減すること。これは、畳み込み演算における高価な行列乗算に起因する。
  • 元々全結合ネットワーク向けに開発された最小限の努力によるバックプロパゲーション(meProp)技術を、CNNに拡張し、スパースな勾配更新を可能にすること。
  • 上位k個の勾配選択によるスパースなバックプロパゲーションが、計算負荷を顕著に削減しながらも、モデルの精度を維持または向上させることを評価すること。
  • meProp-CNNが、モーメンタムやバッチ正規化などの最適化手法と、CNN学習において互換性を保つかどうかを調査すること。

提案手法

  • バックプロパゲーション中に各層で絶対値の大きさに基づいて上位k個の勾配値のみを選択し、残りのすべての勾配をゼロに設定することで、スパースな更新を実現する。
  • このスパースな勾配更新は畳み込み層に適用され、密行列乗算をスパース演算に変換することで、上位k比に比例して計算コストを削減する。
  • Adamおよびモーメンタム付き確率的勾配降下法と統合され、収束の安定性とスパarsityのバランスを取るために、モーメンタム減衰率が調整される。
  • この手法は畳み込み層に限定して適用され、全結合層は全勾配を使用して更新されることで、最終分類層の性能を維持する。
  • 弱く関連するパラメータを無視する点でドロップアウトに類似した挙動を示し、過学習を低減し、一般化性能を向上させる。
  • バッチ正規化を適用することで、収束をさらに加速し、テスト精度を向上させ、meProp-CNNとの互換性を示している。

実験結果

リサーチクエスチョン

  • RQ1上位k個の勾配選択に基づくスパースなバックプロパゲーション手法は、計算コストを削減しながらも、CNNにおけるモデル精度を維持または向上させることができるか?
  • RQ2上位k比の選択が、CNNにおける収束、精度、過学習に対する耐性にどのように影響を与えるか?
  • RQ3モーメンタムやバッチ正規化などの最適化手法と組み合わせた場合、meProp-CNNの有効性は保たれるか?
  • RQ4特に深層部や全結合層において、勾配の層ごとの分布に依存してmeProp-CNNの性能が敏感になるか?

主な発見

  • バックプロパゲーションで全勾長の5%のみを使用しても、meProp-CNNはMNISTで99.07%のテスト精度を達成し、ベースラインCNNの99.02%と同等またはわずかに上回った。
  • 上位k = 5%、モーメンタム減衰率0.6のモデルは99.27%のテスト精度を達成し、ベースラインを上回り、過学習の程度も低減した。
  • バッチ正規化と組み合わせた場合、上位k = 5%のmeProp-CNNは99.39%のテスト精度を達成し、ベースラインの99.28%を上回った。
  • モーメンタム減衰率0.6が0.9よりも優れた結果を示し、過大なモーメンタムが勾配の多様性を制限し、収束を妨げる可能性があることを示唆した。
  • 複数の実験において一貫した性能を示し、上位k比を5%から10%に変更しても、全バックプロパゲーションと比較して安定的かつしばしば精度が向上した。
  • 重要でないパラメータの更新をスキップすることで、meProp-CNNはドロップアウトと同様に、過学習を内因的に低減するが、高いモデル容量を維持できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。