Skip to main content
QUICK REVIEW

[論文レビュー] On the Depth of Deep Neural Networks: A Theoretical View

Shizhao Sun, Wei Chen|arXiv (Cornell University)|Jun 17, 2015
Adversarial Robustness in Machine Learning参考文献 32被引用数 6
ひとこと要約

本稿は、マージンバウンドを用いて深層ニューラルネットワーク(DNN)における深さの理論的役割を調査し、トレードオフを明らかにしている。より深いネットワークは、一般化性能を損なうラデマッハ平均(RA)を増加させるが、同時に表現力も向上させ、経験的マージン誤差を低減する。このトレードオフを緩和するため、著者らはマージンに基づくペナルティ項を導入したLarge Margin DNN(LMDNN)を提案し、MNISTおよびCIFAR-10で顕著なテスト精度の向上を達成した。理論の実証的妥当性が裏付けられた。

ABSTRACT

People believe that depth plays an important role in success of deep neural networks (DNN). However, this belief lacks solid theoretical justifications as far as we know. We investigate role of depth from perspective of margin bound. In margin bound, expected error is upper bounded by empirical margin error plus Rademacher Average (RA) based capacity term. First, we derive an upper bound for RA of DNN, and show that it increases with increasing depth. This indicates negative impact of depth on test performance. Second, we show that deeper networks tend to have larger representation power (measured by Betti numbers based complexity) than shallower networks in multi-class setting, and thus can lead to smaller empirical margin error. This implies positive impact of depth. The combination of these two results shows that for DNN with restricted number of hidden units, increasing depth is not always good since there is a tradeoff between positive and negative impacts. These results inspire us to seek alternative ways to achieve positive impact of depth, e.g., imposing margin-based penalty terms to cross entropy loss so as to reduce empirical margin error without increasing depth. Our experiments show that in this way, we achieve significantly better test performance.

研究の動機と目的

  • マージンバウンドを用いて、深さがDNNの一般化性能に与える影響を理論的に分析すること。
  • 深さの二重的役割を同定すること:表現力の向上と同時に、一般化性能に悪影響を及げるラデマッハ平均(RA)の増加。
  • 深さを増加させることなく、深さに類似した利点を達成する代替手法を提案することで、このトレードオフを解消すること。
  • マージンに基づく正則化が、標準DNNを上回るテスト性能を達成することを、実験的に検証すること。

提案手法

  • マルチクラス設定におけるDNNのラデマッハ平均(RA)の上界を導出し、それが深さに伴い増加することを示す。
  • ベッチ数に基づく複雑度を用いて表現力を測定し、より深いネットワークがより高い複雑度を持つことを実証する。
  • 交差エントロピー損失にマージンに基づくペナルティ項を追加することで、2つの大マージンDNN(LMDNN)アルゴリズムを提案する:1つはマージン違反のL2ノルム(C1)を用い、もう1つはL1ノルム(C2)を用いる。
  • バックプロパゲーションを用いてペナルティ付き損失を最小化することで、経験的マージン誤差を低減するとともに、容量を制御する。
  • 適切にチューニングされたアーキテクチャ(MNISTにはLeNet、CIFAR-10にはAlexNet)を用い、10回のランダム初期化における平均テスト誤差を報告する。
  • ハイパーパramータの感度を調査するため、さまざまなマージンペナルティ係数(λ)の下で性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1DNNの深さを増加させることは、常にテスト性能を向上させるのか、それともトレードオフが存在するのか?
  • RQ2深さは、マージンバウンドにおけるラデマッハ平均(RA)項にどのように影響を与え、一般化性能にどのような影響を及えるのか?
  • RQ3より深いネットワークが、高い表現力のおかげで経験的マージン誤差をどの程度低減できるのか?
  • RQ4マージンに基づく正則化は、深さを増加させずに標準DNNを上回るテスト性能を達成できるのか?
  • RQ5提案されたLMDNN手法の性能は、マージンペナルティ係数λの選択にどの程度敏感か?

主な発見

  • マージンバウンドにおけるラデマッハ平均(RA)項は、深さに伴い増加し、一般化性能への悪影響を示している。
  • より深いネットワークは顕著に高いベッチ数に基づく複雑度を示しており、これは高い表現力と低い経験的マージン誤差を意味する。
  • LMDNN-C1は、MNISTのテスト誤差を0.899%から0.734%に、CIFAR-10では18.339%から17.598%に低減し、顕著な性能向上を達成した。
  • LMDNN-C2は、MNISTのテスト誤差を0.736%、CIFAR-10を17.728%に低減し、標準DNNを常に上回る一貫した改善を示した。
  • LMDNNでは、標準DNNよりも経験的マージン誤差が一貫して低く、この低減がテスト性能の向上と相関していた。
  • LMDNNが標準DNNを上回る性能を示す最適なλの範囲が存在する。λが大きすぎると、マージンペナルティの最適化が不十分になり、性能が低下する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。