Skip to main content
QUICK REVIEW

[論文レビュー] Provable Methods for Training Neural Networks with Sparse Connectivity

Hanie Sedghi, Anima Anandkumar|arXiv (Cornell University)|Dec 8, 2014
Sparse and Compressive Sensing Techniques参考文献 21被引用数 11
ひとこと要約

本稿では、モーメント法を用いた、スパース接続を持つ深層フィードフォワードニューラルネットワークの訓練を、証明可能保証付きで行う手法を提案する。スティーンの補題を用いてラベルと入力スコア関数の間のクロスモーメントを分析することで、このモーメント行列の特異値分解が第1層重み行列の行空間を回復することを示し、$µ_1$-正則化最適化により、弱い非退化条件のもとでスパースな第1層重みの正確回復が可能である。

ABSTRACT

We provide novel guaranteed approaches for training feedforward neural networks with sparse connectivity. We leverage on the techniques developed previously for learning linear networks and show that they can also be effectively adopted to learn non-linear networks. We operate on the moments involving label and the score function of the input, and show that their factorization provably yields the weight matrix of the first layer of a deep network under mild conditions. In practice, the output of our method can be employed as effective initializers for gradient descent.

研究の動機と目的

  • スパース接続を持つ深層ニューラルネットワークの訓練に対して理論的保証を備えた手法を開発すること。
  • 従来、非教師ありモデルに限定されていたモーメント法学習を、教師ありで非線形な深層ネットワーク設定に拡張すること。
  • $µ_1$-最適化を用いて第1層重み行列が正確に回復可能な条件を確立すること。
  • ラベルと入力スコア関数の間のクロスモーメントが、低ランク近似および深層ネットワークの初期化に十分な情報を含んでいることを示すこと。
  • 深層学習における事前学習とスコアベース初期化の経験的成功の理論的裏付けを提供すること。

提案手法

  • 本手法は、$ M = \mathbb{E}[y (\nabla_x \log p(x))^\top] $ というクロスモーメント行列を用いる。ここで $ y $ はラベル、$ \nabla_x \log p(x) $ は入力分布のスコア関数である。
  • スティーンの補題を適用することで、$ M = -\mathbb{E}[\nabla_x y] $ を示し、このモーメント行列が入力に関するネットワーク出力の微分と関連することを示す。
  • モーメント行列 $ M $ の特異値分解(SVD)を用いて、第1層重み行列 $ A_1 $ の低ランク近似を取得し、バックプロパゲーションにおける次元削減を可能にする。
  • スパース重みの場合は、非退化仮定のもとでモーメント行列に対する $ \ell_1 $-正則化最適化を適用し、$ A_1 $ の正確な回復を実現する。
  • マルチクラスおよびマルチラベル設定への拡張には、それぞれソフトマックスおよびシグモイド活性化関数を用いる。
  • ネットワークの深さ、重み行列、活性化関数に関する仮定のもとで、チェーンルールおよびスピルマンら(2012)のスパース回復に関する結果を用いて理論的保証を導出する。

実験結果

リサーチクエスチョン

  • RQ1モーメント法は、非教師ありから教師ありで非線形な深層学習にまで、証明可能保証付きで拡張可能か?
  • RQ2ラベルと入力スコア関数の間のクロスモーメントが、第1層重み行列の回復に十分な情報を含んでいるか?
  • RQ3スパースな第1層重みが深層ニューラルネットワークで $ \ell_1 $-最適化によって正確に回復可能な条件は何か?
  • RQ4スティーンの補題は、非線形モデルにおいてスコア関数とネットワーク勾配の間の接続をどのように可能にするか?
  • RQ5このフレームワークは中間層へ応用可能か?その場合に必要な構造的制約は何か?

主な発見

  • ラベルと入力スコア関数の間のクロスモーメント行列 $ M $ の特異値分解により、第1層重み行列 $ A_1 $ の行空間が回復され、効果的な低ランク初期化が可能になる。
  • 非退化およびスパース性の仮定のもとで、モーメント行列に対する $ \ell_1 $-正則化最適化により、$ A_1 $ の行正規化版が指数的失敗確率を抑えて正確に回復される。
  • 本手法はスパースレベルが $ \sqrt{k} $ まで達する場合に回復を達成でき、先行研究が $ k^\gamma $($ \gamma \leq 0.2 $)に制限されていたのに対し、優れた性能を示す。
  • 理論的分析により、スコア関数を学習する事前学習手法が、スコアとラベル情報の整合性を高めることでバックプロパゲーションを改善できることを示し、経験的効果の裏付けが得られた。
  • 本フレームワークはマルチクラス(ソフトマックス)およびマルチラベル(シグモイド)分類タスクの両方へ適用可能である。
  • 本手法は、教師あり設定において一般非線形深層ネットワークのパラメータの部分集合を学習するための、初めての証明可能手法を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。