Skip to main content
QUICK REVIEW

[論文レビュー] Surfing: Iterative optimization over incrementally trained deep networks

Ganlin Song, Zhou Fan|arXiv (Cornell University)|Jul 19, 2019
Sparse and Compressive Sensing Techniques参考文献 19被引用数 4
ひとこと要約

本稿では、生成モデルにおける入力回復のための反復的最適化手法である「サーフィング」を提案する。この手法は、段階的に訓練された深層ネットワークを活用し、最終モデルの直接勾配降下に失敗する非凸な損失関数の下でも、入力 $x$ の改善を可能にする。$\theta_t$ として段階的に訓練されたネットワークパラメータを用い、損失関数の表面を滑らかな初期状態から複雑な最終形に段階的に移行させることで、直接勾配降下に比べて優れた収束性能を達成する。

ABSTRACT

We investigate a sequential optimization procedure to minimize the empirical risk functional $f_{\hatθ}(x) = \frac{1}{2}\|G_{\hatθ}(x) - y\|^2$ for certain families of deep networks $G_θ(x)$. The approach is to optimize a sequence of objective functions that use network parameters obtained during different stages of the training process. When initialized with random parameters $θ_0$, we show that the objective $f_{θ_0}(x)$ is "nice'' and easy to optimize with gradient descent. As learning is carried out, we obtain a sequence of generative networks $x \mapsto G_{θ_t}(x)$ and associated risk functions $f_{θ_t}(x)$, where $t$ indicates a stage of stochastic gradient descent during training. Since the parameters of the network do not change by very much in each step, the surface evolves slowly and can be incrementally optimized. The algorithm is formalized and analyzed for a family of expansive networks. We call the procedure {\it surfing} since it rides along the peak of the evolving (negative) empirical risk function, starting from a smooth surface at the beginning of learning and ending with a wavy nonconvex surface after learning is complete. Experiments show how surfing can be used to find the global optimum and for compressed sensing even when direct gradient descent on the final learned network fails.

研究の動機と目的

  • 最終段階で訓練されたネットワークに対する直接勾配降下が、非凸な損失関数のため失敗する場合に、深層生成モデルの入力最適化を困難とする課題に対処すること。
  • 確率的学習におけるネットワークパラメータの段階的変化を活用し、入力 $x$ の安定的かつ段階的な最適化を可能にすること。
  • ランダム初期化から完全な訓練までに変化する経験的リスク表面を乗り越える、新しいアルゴリズム「サーフィング」を形式化・分析すること。
  • 特に圧縮センシングやグローバル最適解の回復において、最終モデルに対する直接最適化を上回ることを示すこと。

提案手法

  • 各学習段階 $t$ において、前段階のネットワーク $G_{\theta_{t-1}}(x)$ で損失を最小化した入力 $x^*_{t-1}$ を初期値とし、$f_{\theta_t}(x) = \frac{1}{2}\|G_{\theta_t}(x) - y\|^2$ に対して勾配降下を実行する。
  • 確率的勾配降下におけるパラメータ更新が小さいことを利用し、損失関数の表面がゆっくりと連続的に変化することを前提とする。
  • 理論的分析により、十分に広い幅のReLUネットワークでは、初期損失関数 $f_{\theta_0}(x)$ は良好に振る舞い、$x_0$ および $-x_0$ の小さな近傍以外のすべての点で降下方向が存在することが示される。
  • ReLU活性化関数に起因する区分的二次関数的表面を扱うために理論的分析では投影勾配降下を用いるが、実際の応用では単純な勾配降下でも十分に機能することが確認されている。
  • アルゴリズムは拡張型ReLUネットワークを想定して形式化され、グローバル最小解が $t$ と共に連続的に変化すると仮定して分析されている。
  • 実験により、VAEおよびGANで訓練されたネットワークにおいて、圧縮センシングやグローバル最適解の回復において性能向上が確認されている。

実験結果

リサーチクエスチョン

  • RQ1段階的に訓練されたネットワークを用いた反復的最適化は、最終モデルに対する直接最適化に比べ、入力回復を改善できるか?
  • RQ2深層生成モデルにおいて、ランダム初期化から完全な訓練に至るまでの経験的リスク関数の幾何的性質はどのように変化するか?
  • RQ3グローバル最小解が訓練中に安定的かつ連続的に変化する条件は何か? これにより、段階的最適化が可能になる。
  • RQ4直接勾配降下が最終モデルで失敗する状況下でも、サーフィング手法は信頼性を持ってグローバル最適解に到達できるか?
  • RQ5ランダム初期化されたネットワークにおける初期損失関数 $f_{\theta_0}(x)$ に対して、どのような理論的保証が得られるか?

主な発見

  • ランダムに初期化されたReLUネットワークの初期損失関数 $f_{\theta_0}(x)$ は良好に振る舞う:$x_0$ および $-x_0$ の小さな近傍以外のすべての点で降下方向が存在し、信頼性の高い最適化が可能である。
  • サーフィングは、特に非凸な損失関数の下で、圧縮センシングにおける入力回復やグローバル最適解の回復において、最終モデルに対する直接勾配降下を顕著に上回る性能を示す。
  • 理論的分析により、拡張型ReLUネットワークでは損失関数の表面が滑らかに変化することが確認され、段階的最適化戦略の有効性が裏付けられる。
  • 理論的分析では、ReLUネットワークの区分的二次関数的表面を乗り越えるために投影勾配降下が有効であるが、実際の応用では単純な勾配降下で十分に機能する。
  • 実験的結果により、サーフィングは直接最適化が失敗する場合でも収束を維持することが示され、VAEおよびGANアーキテクチャにわたり高いロバスト性を示している。
  • 本手法は、グローバル最小解が訓練に伴い連続的に変化すると仮定している。最小解の不連続性が生じると、アルゴリズムの有効性が損なわれる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。