Skip to main content
QUICK REVIEW

[論文レビュー] When Will Gradient Methods Converge to Max-margin Classifier under ReLU Models?

Tengyu Xu, Yi Zhou|arXiv (Cornell University)|Jun 12, 2018
Stochastic Gradient Optimization Techniques参考文献 20被引用数 13
ひとこと要約

本稿は、指数損失を用いた二値分類におけるReLUベースのニューラルネットワークにおける勾配降下法(GD)および確率的勾配降下法(SGD)の暗黙のバイアスを調査する。GDは、非凸で滑らかでない損失関数の下で、真の最良マージン方向、局所的最良マージン方向、または発散する可能性があるが、これは非凸で滑らかでない損失関数の下で生じる偽の漸近的局所最小値に起因する。これは、線形モデルではGDが常に真の最良マージン解に収束するのとは対照的である。

ABSTRACT

We study the implicit bias of gradient descent methods in solving a binary classification problem over a linearly separable dataset. The classifier is described by a nonlinear ReLU model and the objective function adopts the exponential loss function. We first characterize the landscape of the loss function and show that there can exist spurious asymptotic local minima besides asymptotic global minima. We then show that gradient descent (GD) can converge to either a global or a local max-margin direction, or may diverge from the desired max-margin direction in a general context. For stochastic gradient descent (SGD), we show that it converges in expectation to either the global or the local max-margin direction if SGD converges. We further explore the implicit bias of these algorithms in learning a multi-neuron network under certain stationary conditions, and show that the learned classifier maximizes the margins of each sample pattern partition under the ReLU activation.

研究の動機と目的

  • 非線形なReLUモデルにおける勾配法の暗黙のバイアスを理解すること。これまでの研究は線形分類器に限定されていた。
  • 指数損失の下で、ReLUモデルにおけるGDおよびSGDが最良マージン方向に収束するか、非凸で滑らかでない損失関数の下でどのように振る舞うかを分析すること。
  • 確率的サンプリング(復元抽出)のもとで、SGDの反復ごとの収束を確立し、従来のエポック単位の結果を拡張すること。
  • 多ニューロンReLUネットワークにおける暗黙のバイアスを調査し、各サンプルパターンの分割に対してマージンを最大化することを示すこと。
  • ReLUモデルの損失関数の形状を特徴づけ、線形モデルとは異なり、漸近的全域最小値と偽の局所最小値の両方が存在することを明らかにすること。

提案手法

  • 指数損失の下でのReLUモデルの非凸で滑らかでない損失関数の形状を分析し、漸近的全域最小値と偽の局所最小値の存在を証明する。
  • 漸近的解析を用いて、GDの収束行動を4つのケースに分類する:全域最良マージン方向への収束、局所的最良マージン方向への収束、有限の偽の局所最小値への収束、または収束しない振動。
  • 指数損失とReLU活性化関数の構造を活用し、SGDの期待値における収束を分析するための新しい技術的フレームワークを適用する。
  • ニューロンの活性化に基づくパターン分割機構を導入し、各分割がマージン最大化の部分空間に対応することを示す。
  • 重み更新を正規化された方向に関する再パラメータ化することで、各分割における最良マージン方向への収束分析を可能にする。
  • ステップサイズの変換と再帰的重み更新解析を用いて、期待される正規化された重みベクトルが、$\mathcal{O}(1/\ln t)$ のレートで最良マージン方向に収束することを示す。

実験結果

リサーチクエスチョン

  • RQ1ReLUモデルにおける勾配降下法は最良マージン方向に収束するのか、それとも偽の局所最小値に閉じ込められるのか?
  • RQ2特に復元抽出の下で、ReLUモデルにおけるSGDの暗黙のバイアスはGDとどのように異なるのか?
  • RQ3損失関数の形状がReLUモデルの収束行動に与える影響は、線形モデルと比較してどう異なるのか?
  • RQ4多ニューロンReLUネットワークの暗黙のバイアスは、ニューロンの活性化によって定義されるサンプルパターンの分割ごとのマージン最大化として特徴づけられるか?
  • RQ5SGDが期待値においてReLUモデルで全域または局所的最良マージン方向に収束する条件は何か?

主な発見

  • 指数損失の下でのReLUモデルの損失関数の形状は非凸で滑らかでなく、漸近的全域最小値と偽の局所最小値の両方を有する。
  • 勾配降下法は、全域最良マージン方向、局所的最良マージン方向、有限の偽の局所最小値、または収束しない振動のいずれかに収束する可能性がある。
  • 確率的勾配降下法は、復元抽出の下で収束する限り、期待値において全域または局所的最良マージン方向に収束する。
  • 多ニューロンReLUネットワークでは、学習された分類器は、ニューロンの活性化によって定義される各サンプルパターンの分割に対してマージンを最大化する。
  • 各分割における期待される正規化された重みベクトルは、変換されたステップサイズ解析を通じて、$\mathcal{O}(1/\ln t)$ のレートで最良マージン方向に収束する。
  • 解析により、パターン分割内のすべてのニューロンの寄与ベクトルが同じ符号を持つ必要があり、かつその分割内のすべてのサンプルが同じラベルを持つことが判明し、これによりマージンの最大化が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。