Skip to main content
QUICK REVIEW

[論文レビュー] An Optimal Transport View on Generalization

Jingwei Zhang, Tongliang Liu|arXiv (Cornell University)|Nov 8, 2018
Stochastic Gradient Optimization Techniques参考文献 34被引用数 4
ひとこと要約

本稿は、機械学習における一般化誤差をバウンディングするための新しい最適輸送フレームワークを導入する。このフレームワークは、アルゴリズム的輸送コスト——訓練例を与えられたときのモデル出力とその条件付き出力との間の期待 Wasserstein 距離——を活用する。部分ガウス分布や有界損失の仮定を必要とせず、一般化誤差のバウンディングを導出し、情報理論的および学習理論的概念(VC次元、KL発散度など)と関連付ける。また、深層ニューラルネットワーク(DNN)が階層的構造と f-発散度の収縮により、深さが増すにつれて一般化誤差が指数関数的に減少することを示す。

ABSTRACT

We derive upper bounds on the generalization error of learning algorithms based on their \emph{algorithmic transport cost}: the expected Wasserstein distance between the output hypothesis and the output hypothesis conditioned on an input example. The bounds provide a novel approach to study the generalization of learning algorithms from an optimal transport view and impose less constraints on the loss function, such as sub-gaussian or bounded. We further provide several upper bounds on the algorithmic transport cost in terms of total variation distance, relative entropy (or KL-divergence), and VC dimension, thus further bridging optimal transport theory and information theory with statistical learning theory. Moreover, we also study different conditions for loss functions under which the generalization error of a learning algorithm can be upper bounded by different probability metrics between distributions relating to the output hypothesis and/or the input data. Finally, under our established framework, we analyze the generalization in deep learning and conclude that the generalization error in deep neural networks (DNNs) decreases exponentially to zero as the number of layers increases. Our analyses of generalization error in deep learning mainly exploit the hierarchical structure in DNNs and the contraction property of $f$-divergence, which may be of independent interest in analyzing other learning models with hierarchical structure.

研究の動機と目的

  • 最適輸送理論を用いて、学習アルゴリズムにおける一般化誤差を分析する新しい理論的フレームワークを開発すること。
  • 部分ガウス分布や有界性といった制限的な損失関数の仮定を必要としない一般化誤差バウンディングを導出すること。
  • アルゴリズム的輸送コストを、全変動距離、KL発散度、VC次元などの指標と関連付けることで、最適輸送と情報理論・統計学習理論を結びつけること。
  • 高容量であるにもかかわらず一般化性能が良いとされる深層ニューラルネットワーク(DNN)における一般化を分析すること。
  • DNNにおける一般化誤差が深さに伴い指数関数的に減少することを確立し、これは階層的構造と f-発散度の収縮に起因することを示すこと。

提案手法

  • アルゴリズム的輸送コストを、訓練例を与えられたときの出力仮説とその条件付きバージョンとの間の期待 Wasserstein 距離として定義する。
  • この輸送コストに基づいて、分布的仮定なしに有効なリプシッツ連続損失関数に対して一般化誤差の上界を導出する。
  • 不等式を用いて、アルゴリズム的輸送コストを全変動距離、相対エントロピー、ヘリンジャー距離などの他の確率的距離指標と関連付ける。
  • VC次元やその他の複雑度測度による輸送コストのバウンディングを通じて、古典的学習理論と接続する。
  • DNNにこのフレームワークを適用する際、DNNを階層的特徴マッピングのマルコフ連鎖としてモデル化し、部分ガウス発散度不等式(SDPI)を用いて層間の相互情報量をバウンディングする。
  • 層間における f-発散度の収縮性質を用いて、最終仮説と訓練データ間の相互情報量が深さに伴い指数関数的に減少することを示す。

実験結果

リサーチクエスチョン

  • RQ1部分ガウス分布や有界損失関数の仮定なしに、最適輸送距離を用いて一般化誤差をバウンディングできるか?
  • RQ2アルゴリズム的輸送コストを、VC次元やKL発散度といった古典的学習理論的および情報理論的測度とどのように関連付けることができるか?
  • RQ3深層ニューラルネットワークの階層的構造が一般化誤差の制御に果たす役割は何か?
  • RQ4f-発散度の収縮性質を用いて、深層学習における一般化誤差の指数関数的減少を導出できるか?
  • RQ5提案されたフレームワークは、正則化を用いた高確率一般化バウンディングおよびアルゴリズム設計をどのように可能にするか?

主な発見

  • 一般化誤差は、分布的仮定なしにリプシッツ連続損失関数に対して、訓練例を与えられたときの出力仮説とその条件付きバージョンとの間の期待 Wasserstein 距離によって上界で抑えられる。
  • アルゴリズム的輸送コストは、全変動距離、相対エントロピー、VC次元を用いてバウンディング可能であり、最適輸送と情報理論・学習理論を橋渡しする。
  • 有界損失関数に対しては、全変動距離型の一般化バウンディングが導出され、距離不等式を用いてヘリンジャー距離や χ² 距離によってさらにバウンディング可能である。
  • 深層ニューラルネットワークでは、階層的構造と層間における f-発散度の収縮により、一般化誤差が層数の増加に伴い指数関数的に減少する。
  • 最終仮説と訓練データ間の相互情報量は、深さに伴い指数関数的に減少し、その減少率は層間の収縮係数の幾何平均によって決定される。
  • このフレームワークは、導出された一般化バウンディングを目的関数に組み込むことで、フィッティングと一般化のバランスを取る正則化の設計が可能であると示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。