Skip to main content
QUICK REVIEW

[論文レビュー] A Tight Excess Risk Bound via a Unified PAC-Bayesian-Rademacher-Shtarkov-MDL Complexity

Peter Grünwald, Nishant A. Mehta|Data Archiving and Networked Services (DANS)|Oct 21, 2017
Machine Learning and Algorithms参考文献 27被引用数 7
ひとこと要約

本稿は、データに依存しないラデマッハ複雑度、情報複雑度、および正規化最大尤度(NML)複雑度を結びつける統一的なPACベイジアン–ラデマッハ–シュタルコフ–MDL複雑度を導入する。この新しい複雑度を用いて、VCおよび大規模な多項式エントロピークラスにおける最適レートをベルンシュタイン条件のもとで一般化する、タイトな超過リスクバウンドを確立する。同時に、モデルの複雑さと「容易さ」条件(ベルンシュタイン条件)を明確に分離する。

ABSTRACT

We present a novel notion of complexity that interpolates between and generalizes some classic existing complexity notions in learning theory: for estimators like empirical risk minimization (ERM) with arbitrary bounded losses, it is upper bounded in terms of data-independent Rademacher complexity; for generalized Bayesian estimators, it is upper bounded by the data-dependent information complexity (also known as stochastic or PAC-Bayesian, $\mathrm{KL}( ext{posterior} \operatorname{\|} ext{prior})$ complexity. For (penalized) ERM, the new complexity reduces to (generalized) normalized maximum likelihood (NML) complexity, i.e. a minimax log-loss individual-sequence regret. Our first main result bounds excess risk in terms of the new complexity. Our second main result links the new complexity via Rademacher complexity to $L_2(P)$ entropy, thereby generalizing earlier results of Opper, Haussler, Lugosi, and Cesa-Bianchi who did the log-loss case with $L_\infty$. Together, these results recover optimal bounds for VC- and large (polynomial entropy) classes, replacing localized Rademacher complexity by a simpler analysis which almost completely separates the two aspects that determine the achievable rates: 'easiness' (Bernstein) conditions and model complexity.

研究の動機と目的

  • 学習理論における分散した複雑度概念—ラデマッハ、PACベイジアン、シュタルコフ/NML—を一つの枠組みに統合すること。
  • ERM、ベイジアン推定器、ペナルティ付きERMの既存のバウンドを包含するタイトな超過リスクバウンドを導出すること。
  • 従来の$L_∞$エントロピーに基づく結果を超えて、超過リスクと$L_2(P)$エントロピーの関係を一般化すること。
  • 局所化されたラデマッハ複雑度に依存せずに、ベルンシュタイン条件のもとで大規模クラスに対するミニマックス最適レートを回復できること。
  • モデルの複雑さと「容易さ」(ベルンシュタイン)条件が学習レートに与える影響を明確にすること。

提案手法

  • ラデマッハ複雑度と情報複雑度の間を滑らかに補間する、新しい複雑度測度$\text{comp}_\eta(\mathcal{F}, \hat{\Pi}, w, Z^n)$を提案する。
  • 任意の推定器$\hat{\Pi}$のアンナールド超過リスクを、この新しい複雑度と経験的リスクに関連付ける主バウンドを確立する。
  • シュタルコフ積分(ミニマックス対数損失レジスト)から$L_2(P)$エントロピーへの、ラデマッハ複雑度を介したバウンドの鎖を構築する。
  • コルチンスキーの結果(ラデマッハ複雑度と経験エントロピーの関係)を応用し、従来の$L_∞$エントロピー結果を$L_2$に一般化する。
  • ペナルティ付きERMに対して、新しい複雑度がNML複雑度に簡約され、ログロス設定でミニマックス最適レートが回復されることを示す。
  • 分割やチェインイングを明示的に用いない、固定点フリーなチューニング戦略を採用し、従来の方法に比べてより単純な解析を可能にする。

実験結果

リサーチクエスチョン

  • RQ1一貫した複雑度測度が、PACベイジアン、ラデマッハ、NML複雑度の超過リスクバウンドを統合できるか?
  • RQ2新しい複雑度は$L_2(P)$エントロピーとどのように関係するか? そして、$L_∞$エントロピーに基づく手法に比べてタイトなバウンドをもたらすか?
  • RQ3提案された枠組みは、局所化されたラデマッハ複雑度に依存せずに、ベルンシュタイン条件のもとで大規模クラスに対するミニマックス最適レートを回復できるか?
  • RQ4任意の有界損失関数に対して、シュタルコフ積分(ミニマックス対数損失レジスト)とラデマッハ複雑度の関係は何か?
  • RQ5新しい枠組みは、非有界損失やオーディベルのスターエstimaterのようなアグリゲーション手法に対しても、どの程度拡張可能か?

主な発見

  • 提案された複雑度$\text{comp}_\eta$は、ラデマッハ複雑度、情報複雑度、NML複雑度を一般化し、統一的な超過リスクバウンドを提供する。
  • 定理4における主バウンドは、アンナールド超過リスクを経験的リスクと新しい複雑度に関連づけ、VCおよび大規模な多項式エントロピークラスに対してタイトなレートをもたらす。
  • 本稿は、ミニマックス対数損失レジスト(シュタルコフ積分)と$L_2(P)$エントロピーの間の新たな関係を確立し、従来の$L_∞$エントロピー結果を一般化する。
  • この枠組みは、モデルの複雑さと「容易さ」(ベルンシュタイン)条件の影響を明確に分離でき、局所化されたラデマッハ複雑度に依存する手法に比べて、より単純な解析を可能にする。
  • ペナルティ付きERMに対して、新しい複雑度はNML複雑度に簡約され、ログロス設定でミニマックス最適レートが回復される。
  • アギューベルトとバウシュェ(2007)とは異なり、チェインイング技法を明示的に用いないにもかかわらず、最適レートを達成している。これは、より透明性とモジュラリティの高い解析を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。