Skip to main content
QUICK REVIEW

[論文レビュー] Learning Invariances using the Marginal Likelihood

Mark van der Wilk, Matthias Bauer|arXiv (Cornell University)|Aug 16, 2018
Gaussian Processes and Bayesian Inference被引用数 14
ひとこと要約

この論文は、入力不変性をカーネル構造に直接埋め込み、マージナル尤度を最適化することで、ガウス過程モデルにおける不変性を学習する手法を提案する。微分可能サンプリング手順からの不偏カーネル推定を用いた変分推論により、アフィン変換や局所的変形といった最適な不変性を発見するエンドツーエンド学習が可能となり、MNISTの変種において一般化性能が向上する。マージナル尤度は、検証データがなくても優れたモデルを正しく同定する。

ABSTRACT

Generalising well in supervised learning tasks relies on correctly extrapolating the training data to a large region of the input space. One way to achieve this is to constrain the predictions to be invariant to transformations on the input that are known to be irrelevant (e.g. translation). Commonly, this is done through data augmentation, where the training set is enlarged by applying hand-crafted transformations to the inputs. We argue that invariances should instead be incorporated in the model structure, and learned using the marginal likelihood, which correctly rewards the reduced complexity of invariant models. We demonstrate this for Gaussian process models, due to the ease with which their marginal likelihood can be estimated. Our main contribution is a variational inference scheme for Gaussian processes containing invariances described by a sampling procedure. We learn the sampling procedure by back-propagating through it to maximise the marginal likelihood.

研究の動機と目的

  • 教師あり学習におけるデータオーグメンテーションの限界を克服し、モデルの事前分布における不変性モデリングに置き換えること。
  • 回転、ねじれ、変形などの不変性を、ガウス過程モデルにおけるマージナル尤度を目的関数として直接学習可能とすること。
  • 閉形式で表現できない不変カーネルの技術的課題を、微分可能サンプリングによる不偏カーネル推定を用いることで克服すること。
  • マージナル尤度が、不変性パラメータのエンドツーエンド最適化に有効で微分可能な目的関数として機能することを示すこと。
  • 本手法がMNISTの変種において優れた一般化性能を示し、検証データセットを必要とせずにモデル選択が可能であることを示すこと。

提案手法

  • 本手法は、与えられた不変性分布に従って変換された入力を用いて、基本カーネル(例:RBF)を平均化する二重和カーネルを用いる。
  • 不変性の積分や和が閉形式で得られない場合でも、カーネルの不偏推定値にのみ依存する、マージナル尤度の変分下界を導入することで最適化を可能にする。
  • アフィン変換や変形などの不変性は、バックプロパゲーションが可能な微分可能サンプリング手順でモデル化され、不変性パラメータの最適化が可能になる。
  • 不変性変換をパrameter化した分布からのサンプリングにより、カーネル推定値が構築され、不変性構造の勾配ベース最適化が可能になる。
  • 全訓練目的関数は、再パラメータ化勾配を用いた確率的勾配降下法で最大化される、マージナル尤度の変分下界である。
  • 本手法は、GPハイパーパrameterと不変性パラメータをバックプロパゲーションにより同時に最適化できるエンドツーエンド学習をサポートする。

実験結果

リサーチクエスチョン

  • RQ1マージナル尤度を目的関数として用いることで、アフィン変換や局所的変形といった不変性が、ガウス過程モデルで効果的に学習可能かどうか。
  • RQ2検証データセットを必要とせず、マージナル尤度をモデル選択基準として用いた場合、最良の不変性構造を正しく同定できるか。
  • RQ3不変性のための微分可能サンプリング手順が、GPと不変性パラメータの両方のエンドツーエンド最適化を可能にするか。
  • RQ4ベンチマークデータセット(例:MNIST)において、学習された不変性の性能が、手作業によるデータオーグメンテーションや固定不変性仮定と比較してどうなるか。
  • RQ5不変性パラメータ、GPハイパーパラメータ、変分後確率分布を同時に学習する際の最適化ダイナミクスはどのようなものか。

主な発見

  • アフィン変換を学習したGPモデルは、MNISTで1.35%のテスト誤差を達成し、RBFベースラインの2.15%を著しく上回った。
  • 局所的変形を学習したモデルは1.47%のテスト誤差を示し、RBFベースラインを上回った。非剛体変形がMNISTの一般化に剛体回転よりも有益であることが示された。
  • マージナル尤度の下界は、すべての実験において最良のモデルを正しく同定した。これは、共同最適化が真の不変性を初期化したモデルに到達しなくても同様に成立したことを示している。
  • 回転のみに不変なモデルは、RBFベースラインと比べてわずかな改善にとどまり、回転不変性のみではMNISTの一般化に不十分であることが示された。
  • 検証データセットを必要とせず、マージナル尤度が信頼性があり微分可能なモデル選択目的関数として機能した。
  • 回転MNISTの実験では、固定不変性バインディング(例:±45° や ±179°)のモデルが、学習可能なパラメータを持つモデルを上回った。これは共同学習における最適化の課題を示唆しているが、マージナル尤度は依然として最良のモデルを正しく順位付けした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。