Skip to main content
QUICK REVIEW

[論文レビュー] A Unifying View on Implicit Bias in Training Linear Neural Networks

Chulhee Yun, Shankar Krishnan|arXiv (Cornell University)|Oct 6, 2020
Neural Networks and Applications参考文献 35被引用数 12
ひとこと要約

本稿は、全結合型、対角型、畳み込み型アーキテクチャを統合する線形ニューラルネットワークのテンソル定式化を導入し、勾配フローが変換された入力空間における特定のノルムへの暗黙のバイアスに向かって収束することを示している。直交的分解可能なネットワークでは、先行研究よりもはるかに弱い仮定のもとで、分類において $\ell_{2/L}$ マックスマージン解、回帰において最小ノルム解に収束することを証明している。

ABSTRACT

We study the implicit bias of gradient flow (i.e., gradient descent with infinitesimal step size) on linear neural network training. We propose a tensor formulation of neural networks that includes fully-connected, diagonal, and convolutional networks as special cases, and investigate the linear version of the formulation called linear tensor networks. With this formulation, we can characterize the convergence direction of the network parameters as singular vectors of a tensor defined by the network. For $L$-layer linear tensor networks that are orthogonally decomposable, we show that gradient flow on separable classification finds a stationary point of the $\ell_{2/L}$ max-margin problem in a "transformed" input space defined by the network. For underdetermined regression, we prove that gradient flow finds a global minimum which minimizes a norm-like function that interpolates between weighted $\ell_1$ and $\ell_2$ norms in the transformed input space. Our theorems subsume existing results in the literature while removing standard convergence assumptions. We also provide experiments that corroborate our analysis.

研究の動機と目的

  • 全結合型、対角型、畳み込み型ネットワークなどの多様な線形ネットワークアーキテクチャにわたる暗黙のバイアスの分析を統一すること。
  • テンソル特異ベクトルを用いて、線形テンソルネットワークにおける勾配フローの収束方向を特徴付けること。
  • 従来の暗黙のバイアス解析で一般的に使われる強い収束仮定(例えば、全損失の収束や方向の収束)に依存しないようにすること。
  • 線形ネットワークおよび行列因子分解に関する既知の結果を、より広範な直交的分解可能なアーキテクチャのクラスへと拡張すること。
  • さまざまなネットワークタイプにおける勾配フローの極限点に関する理論的予測を、実験的に検証すること。

提案手法

  • アーキテクチャにわたる解析の統一を図るため、ニューラルネットワークの一般化されたテンソル定式化を提案し、その線形版である線形テンソルネットワークを導入する。
  • ネットワーク構造から導かれるテンソルを定義し、その特異ベクトルを用いて勾長フローの収束方向を特徴付ける。
  • 極限点の正確な特徴付けを可能にするために、直交的分解可能なネットワーク(仮定1)の概念を導入する。
  • 勾配フローのダイナミクスと特異値解析を用いて、初期化スケール $\alpha \to 0$ のとき、各層における特異ベクトルが一致することを示す。
  • 行列摂動理論とノルムの有界性を用いて、初期化が小さいとき特異値が0から離れていることを証明する。
  • 初期化スケール $\alpha \to 0$ のときのネットワーク出力パラメータ $\bm{\beta}_{\rm fc}$ の極限を解析し、$\bm{X}$ の行空間における最小 $\ell_2$ ノルム解に収束することを示す。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、異なる線形ネットワークアーキテクチャにわたる暗黙のバイアスを統一的な枠組みで記述できるか?
  • RQ2線形テンソルネットワークにおける勾長フローの収束方向は何か? また、それはテンソル特異ベクトルとどのように関係するか?
  • RQ3直交的分解可能なネットワークにおける勾長フローが、分類において $\ell_{2/L}$ マックスマージン解に収束する条件は何か?
  • RQ4損失関数やパラメータの収束を仮定しないで、不定線形回帰における暗黙のバイアスを特徴付けられるか?
  • RQ5初期化スケール $\alpha$ は、勾長フローが最小ノルム解に収束するのに対してどのように影響を与えるか?

主な発見

  • 線形全結合ネットワークでは、勾長フローが最小 $\ell_2$ ノルム解に収束し、より少ない仮定のもとで既知の結果を再現する。
  • 直交的分解可能なネットワークでは、変換された入力空間において $\ell_{2/\text{depth}}$ マックスマージン解に勾長フローが収束し、畳み込み型および対角型ネットワークに関する先行結果を一般化する。
  • 不定線形回帰では、損失やパラメータの収束を仮定せず、変換された空間における重み付き $\ell_1$ と $\ell_2$ ノルムの間を補間するノルムを最小化するグローバル最小値に勾長フローが収束する。
  • 深さのある線形全結合ネットワークでは、初期化スケール $\alpha \to 0$ のとき、勾長フローが最小 $\ell_2$ ノルム解に収束し、より弱い条件下でも既知の挙動を確認する。
  • ネットワーク出力パラメータ $\bm{\beta}_{\rm fc}$ の極限は $\bm{X}$ の行空間にあり、一意の最小 $\ell_2$ ノルム解 $\bm{X}^T(\bm{X}\bm{X}^T)^{-1}\bm{y}$ に収束する。
  • 実験により、初期化スケールを変化させたさまざまなネットワークタイプ(全結合型、対角型、畳み込み型)において、勾長デシントの軌道が理論的予測された極限点と一致することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。