Skip to main content
QUICK REVIEW

[論文レビュー] PAC-Bayes Un-Expected Bernstein Inequality

Zakaria Mhammedi, Peter Grünwald|arXiv (Cornell University)|May 31, 2019
Machine Learning and Algorithms被引用数 8
ひとこと要約

本稿では、標準的な $√{L_n \cdot \text{KL}/n}$ の複雑さ項を、アルゴリズムの安定性下で消える第二階層の項 $V_n$ に置き換える新しい PAC-Bayesian一般化境界を導入する。これは、Bernstein/Tsybakov 条件が成り立つ場合に、収束速度が速くなる。主な革新点は、$X^2$ を期待値の外に出すことで、大幅にタイトな境界を達成する新しい集中不等式を導入したことである。合成データおよび UCI データセットにおいて、$L_n$ がゼロでない場合でも、特に優れた性能を発揮する。

ABSTRACT

We present a new PAC-Bayesian generalization bound. Standard bounds contain a $\sqrt{L_n \cdot \KL/n}$ complexity term which dominates unless $L_n$, the empirical error of the learning algorithm's randomized predictions, vanishes. We manage to replace $L_n$ by a term which vanishes in many more situations, essentially whenever the employed learning algorithm is sufficiently stable on the dataset at hand. Our new bound consistently beats state-of-the-art bounds both on a toy example and on UCI datasets (with large enough $n$). Theoretically, unlike existing bounds, our new bound can be expected to converge to $0$ faster whenever a Bernstein/Tsybakov condition holds, thus connecting PAC-Bayesian generalization and {\em excess risk\/} bounds---for the latter it has long been known that faster convergence can be obtained under Bernstein conditions. Our main technical tool is a new concentration inequality which is like Bernstein's but with $X^2$ taken outside its expectation.

研究の動機と目的

  • 標準的な PAC-Bayesian 境界が $L_n$(経験誤差)に依存するため、$L_n$ がゼロに収束しない場合に収束が遅くなるという限界を是正すること。
  • アルゴリズムの安定性を活用する新しい一般化境界を開発し、$L_n$ を、$L_n$ が非ゼロであっても小さくなる可能性のある第二階層の項 $V_n$ に置き換えること。
  • 新しい境界の収束速度が Bernstein/Tsybakov 条件下で改善されることを示し、PAC-Bayesian 一般化境界と過剰リスク境界を結びつけること。
  • 期待値の外に $X^2$ を持ってくることで、よりタイトな制御が可能になる、新しい集中不等式(「予期しない Bernstein」)を導入すること。

提案手法

  • 定理3で、標準的な $\sqrt{L_n \cdot \text{KL}/n}$ 項を $\sqrt{V_n \cdot \text{KL}/n}$ に置き換えた新しい PAC-Bayesian 境界を提案。ここで $V_n$ は第二階層の安定性測度である。
  • 期待値の外に $X^2$ を持ってくることで、分散に類似した項の制御をタイトにする、新しい集中不等式(補題13)を導入。この不等式は「予期しない Bernstein」と呼ばれる。
  • $V_n$ をデータに依存する安定性測度として定義:全データと部分データ(例:最初の50%)で訓練されたモデルの予測の類似度を測定し、アルゴリズムの安定性を捉える。
  • $V_n$ にオンライン事後分布 $Q(Z_{>i})$ と $Q(Z_{<j})$ を用いることで、完全な標本事後分布への収束を可能にし、実際の応用において境界のタイトさを向上させる。
  • 合成データおよび実世界の UCI データセットにこの境界を適用し、Maurer や TS や Catoni などの最先端の境界と比較する。
  • Maurer や TS の境界との比較をより公平にするために、最初の半分のデータに基づくインフォームドな事前分布を用いる。

実験結果

リサーチクエスチョン

  • RQ1経験誤差 $L_n$ を、安定性に基づく第二階層の項 $V_n$ に置き換えることで、PAC-Bayesian 一般化境界を改善できるか?
  • RQ2Bernstein や Tsybakov 条件が成り立つ場合に、新しい境界は既存の PAC-Bayesian 境界よりも収束が速いか?
  • RQ3期待値の外に $X^2$ を持ってくる新しい集中不等式が、実際の応用においてよりタイトな境界をもたらすか?
  • RQ4実世界のデータセットにおいて、$L_n$ が非ゼロのままでも、新しい境界は最先端の境界を上回る性能を示すか?
  • RQ5アルゴリズムの安定性($V_n$ で測定)は、一般化境界のタイトさをどの程度向上させるか?

主な発見

  • 提案された境界は、合成データおよび UCI データセットの両方で、最先端の PAC-Bayesian 境界を常に上回り、$n$ が大きくなるほど顕著になる。特に $L_n \approx 0.03$(例:MNIST に類似した設定)であっても同様である。
  • UCI データセットでは、新しい境界は Catoni や TS よりもタイトな境界を達成し、絶対値で5%から20%の改善を示す(例:kr-vs-kp で 0.107 対 0.123)。
  • Bernstein/Tsybakov 条件が成り立つ場合、境界の $\sqrt{V_n \cdot \text{KL}/n}$ 項は $\sqrt{L_n \cdot \text{KL}/n}$ 項よりも速く収束する。これにより、PAC-Bayesian 境界と過剰リスク理論が結びつく。
  • 実験では、$L_n$ が大きくても(例:$L_n \approx 0.03$)$V_n$ がゼロに近くなることが示され、従来の境界が失敗する状況でも本境界が安定性を捉えていることが示された。
  • インフォームドな事前分布を用いることで、Maurer の境界など、ベースラインの境界が著しく向上するが、提案された境界は依然としてそれを上回り、$n$ が大きくなるほど顕著になる。
  • 理論的分析により、新しい境界の収束速度は Tsybakov の指数 $\beta$ に依存し、$\beta$ が大きくなるほど改善することが示された。これは過剰リスク境界の挙動と一致する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。