Skip to main content
QUICK REVIEW

[論文レビュー] Are deep ResNets provably better than linear predictors?

Chulhee Yun, Suvrit Sra|arXiv (Cornell University)|Jul 9, 2019
Advanced Neural Network Applications参考文献 32被引用数 5
ひとこと要約

本稿は、幾何的条件下の下で、深層ResNetの最適化ランドスケープにおける任意の臨界点が、最良の線形予測子と同等以上であるか、またはヘッセ行列に厳密に負の固有値を持つことを確立している。これは最適化特性の向上を示唆する。さらに、近アイデンティティ領域におけるリスクおよびラデマッハ複雑度のサイズに依存しない境界を示し、この領域では深さが一般化性能を劣化させないことを示している。

ABSTRACT

Recent results in the literature indicate that a residual network (ResNet) composed of a single residual block outperforms linear predictors, in the sense that all local minima in its optimization landscape are at least as good as the best linear predictor. However, these results are limited to a single residual block (i.e., shallow ResNets), instead of the deep ResNets composed of multiple residual blocks. We take a step towards extending this result to deep ResNets. We start by two motivating examples. First, we show that there exist datasets for which all local minima of a fully-connected ReLU network are no better than the best linear predictor, whereas a ResNet has strictly better local minima. Second, we show that even at the global minimum, the representation obtained from the residual block outputs of a 2-block ResNet do not necessarily improve monotonically over subsequent blocks, which highlights a fundamental difficulty in analyzing deep ResNets. Our main theorem on deep ResNets shows under simple geometric conditions that, any critical point in the optimization landscape is either (i) at least as good as the best linear predictor; or (ii) the Hessian at this critical point has a strictly negative eigenvalue. Notably, our theorem shows that a chain of multiple skip-connections can improve the optimization landscape, whereas existing results study direct skip-connections to the last hidden layer or output layer. Finally, we complement our results by showing benign properties of the "near-identity regions" of deep ResNets, showing depth-independent upper bounds for the risk attained at critical points as well as the Rademacher complexity.

研究の動機と目的

  • 深層ResNetsが最適化および一般化において線形予測子を実際に上回ることを証明すること。
  • 単一ブロックのResNetsに関する先行結果を、複数の残差ブロックを有するより深いアーキテクチャへと拡張すること。
  • 深層ResNetsにおける臨界点の構造を分析し、悪い局所最適解を避けるかどうかを特定すること。
  • 深層ResNetsの近アイデンティティ領域において、リスクやラデマッハ複雑度といった良性特性(有界性など)を確立すること。
  • 出力層への直接的なスキップ接続を超えて、スキップ接続のチェーンが最適化ランドスケープをどのように改善するかを示すこと。

提案手法

  • 任意の臨界点が最良の線形予測子と同等以上であるか、またはヘッセ行列に厳密に負の固有値を持つことを保証するためのネットワークアーキテクチャに関する幾何的条件を導入する。
  • 残差構造を活用して、再帰的にラデマッハ複雑度をバインドするための「はがし取り(peeling-off)」技術を用いる。
  • パrameter制約の下で、近アイデンティティ領域における臨界点でのリスクを分析し、深さに依存しない上界を証明する。
  • ReLU活性化関数と形式 $ x \mapsto x + \mathbf{V}_l \sigma(\mathbf{U}_l x) $ の残差ブロックを有する特定のResNetアーキテクチャを検討する。
  • ヘッセ行列および臨界点における曲率を分析するため、行列解析および最適化理論の道具を適用する。
  • 一般化性能を定量化するためにラデマッハ複雑度を用い、$ \|\mathbf{V}_l\|_F, \|\mathbf{U}_l\|_F \leq O(1/\sqrt{L}) $ の条件下で境界がサイズに依存しないことを示す。

実験結果

リサーチクエスチョン

  • RQ1単一ブロックのResNetsが線形予測子を実際に上回ることの証明が、複数の残差ブロックを有する深層ResNetsへと拡張可能か?
  • RQ2深層ResNetsにおけるスキップ接続のチェーンは、出力層への直接接続を越えて最適化ランドスケープを改善するか?
  • RQ3残差更新が小さい近アイデンティティ領域における深層ResNetsの一般化特性は何か?
  • RQ4深層ResNetsの臨界点におけるヘッセ行列が、局所最適解でないことを示すために、常に負の固有値を持つことが保証される条件は何か?
  • RQ5近アイデンティティ領域における深層ResNetsについて、リスクおよびラデマッハ複雑度のサイズに依存しない境界を確立できるか?

主な発見

  • やや厳しい幾何的条件下では、深層ResNetの最適化ランドスケープにおける任意の臨界点は、最良の線形予測子と同等以上であるか、またはヘッセ行列に厳密に負の固有値を持つ。
  • 深層ResNetsの経験的ラデマッハ複雑度は、$ \frac{B \prod_{l=1}^{L}(1 + 2M_l^2)}{\sqrt{n}} $ でバインドされ、$ M_l = O(1/\sqrt{L}) $ のときサイズに依存しなくなる。
  • 近アイデンティティ領域における任意の臨界点でのリスクは、ネットワークの深さに依存せず有界であり、安定した一般化を示唆する。
  • 解析により、複数のスキップ接続のチェーンが最適化ランドスケープを改善することが示され、先行研究が出力層への直接接続に限定していたのとは対照的である。
  • グローバル最小値であっても、残差ブロックからの表現が層を跨いで単調に改善されるとは限らず、深層ResNetsの解析の複雑さを強調している。
  • 結果として、深さが増大しても近アイデンティティ領域において深層ResNetsが良性な最適化および一般化特性を維持することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。