Skip to main content
QUICK REVIEW

[論文レビュー] On the role of data in PAC-Bayes bounds

Gintare Karolina Dziugaite, Kyle Hsu|arXiv (Cornell University)|Jun 19, 2020
Machine Learning and Algorithms参考文献 15被引用数 19
ひとこと要約

本稿では、訓練データの一部(実効リスク計算に使われない)を条件として用いるデータ依存的事前分布——特に、古典的なオラクル事前分布(期待事後分布)よりも、線形PAC-Bayes一般化境界を著しくタイトにできることが示されている。主な貢献は、このようなデータ依存的事前分布が、ヒューリスティックではなく、特定の設定(特に確率的勾配降下法を用いた非凸学習)において非自明な境界を達成するために不可欠であることを示したことである。

ABSTRACT

The dominant term in PAC-Bayes bounds is often the Kullback--Leibler divergence between the posterior and prior. For so-called linear PAC-Bayes risk bounds based on the empirical risk of a fixed posterior kernel, it is possible to minimize the expected value of the bound by choosing the prior to be the expected posterior, which we call the oracle prior on the account that it is distribution dependent. In this work, we show that the bound based on the oracle prior can be suboptimal: In some cases, a stronger bound is obtained by using a data-dependent oracle prior, i.e., a conditional expectation of the posterior, given a subset of the training data that is then excluded from the empirical risk term. While using data to learn a prior is a known heuristic, its essential role in optimal bounds is new. In fact, we show that using data can mean the difference between vacuous and nonvacuous bounds. We apply this new principle in the setting of nonconvex learning, simulating data-dependent oracle priors on MNIST and Fashion MNIST with and without held-out data, and demonstrating new nonvacuous bounds in both cases.

研究の動機と目的

  • データ依存的事前分布が、古典的なオラクル事前分布を超えて、線形PAC-Bayes境界のタイトさを向上させられるかどうかを調査すること。
  • データ依存的事前分布が、PAC-Bayes境界における期待事後分布よりも優れる条件を同定すること。
  • MNISTおよびFashion MNISTのような非凸学習設定において、データ依存的事前分布が非自明な境界をもたらすことを実験的に検証すること。
  • 事前分布選択におけるデータの役割を、分布的またはゴーストサンプルに基づく事前分布と区別すること。
  • 真のデータ分布が既知であっても、事前分布の構築にデータを用いることが、非自明な境界を達成するために本質的であることを示すこと。

提案手法

  • 訓練データの部分集合Jを条件として事前分布を定義する形式的フレームワークを提案し、Jを実効リスク計算から除外する。
  • 標準的オラクル事前分布とは異なり、データの部分集合を条件として事後分布の期待値をとった「データ依存的オラクル事前分布」の概念を導入する。
  • このようなデータ依存的事前分布が、標準的オラクル事前分布よりも期待境界を改善するための必要十分条件(命題3.1)を導出する。
  • 減少する学習率を用いた線形モデルにおけるSGDのモデルにこのフレームワークを適用し、初期のデータポイントが事後分布に強く影響することを示す。
  • ゴーストサンプルを用いない状況で、MNISTおよびFashion MNISTに対して、ホールドアウトデータを用いてデータ依存的事前分布を推定し、境界を比較する実験的評価を実施する。
  • 固定分散のガウス事前分布を用い、初期のデータポイントにおける条件付き期待値により平均を最適化することで、データ依存的事前分布を模擬する。

実験結果

リサーチクエスチョン

  • RQ1実効リスク推定に使われない訓練データの一部を用いて構築されたデータ依存的事前分布は、標準的オラクル事前分布よりもタイトな線形PAC-Bayes境界をもたらすか?
  • RQ2非自明な境界を達成するために、事前分布構築にデータを用いることが必要となる条件は何か?
  • RQ3実効リスク推定からデータを除外することで生じる過剰バイアスと、初期データに条件づけた情報率の増加のバランスはいかにか?
  • RQ4実際の応用において、ヒューリスティックなデータ依存的事前分布は、最適なデータ依存的事前分布をどの程度近似できるか?
  • RQ5非凸学習の場面(例:画像データセットにおけるSGD)において、データ依存的事前分布が非自明な境界を可能にするか?

主な発見

  • 標準的オラクル事前分布(期待事後分布)は最適でないことがあり、データ依存的事前分布は著しくタイトな境界をもたらすことがある。
  • 減少する学習率を用いたSGDのモデルでは、オラクル事前分布は自明な境界をもたらすが、初期データポイントに基づくデータ依存的事前分布は非自明な境界をもたらす。
  • データ依存的事前分布の優位性は、初期データに条件づけた情報率の増加が、そのデータを実効リスクから除外することで生じる過剰バイアスを上回る場合に顕著に現れる。
  • MNISTおよびFashion MNISTにおける実験結果から、ゴーストサンプルを用いなくても、データ依存的事前分布は非自明な境界をもたらすことが示された。これは、この文脈において、データ依存性が分布依存性よりもより大きな影響を持つことを示唆している。
  • 形式的根拠がなかったにもかかわらず、データを用いて事前分布を構築するヒューリスティックな手法が、理論的に正当化され、特定の設定では境界をタイトにするために不可欠であることが示された。
  • 提案手法により、従来のPAC-Bayes境界がKLダイバージェンス項が大きいために失敗しがちな非凸学習の文脈でも、非自明な境界が達成可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。