Skip to main content
QUICK REVIEW

[論文レビュー] Scaling-up Empirical Risk Minimization: Optimization of Incomplete U-statistics

Stéphan Clémençon, Aurélien Bellet|arXiv (Cornell University)|Jan 12, 2015
Stochastic Gradient Optimization Techniques参考文献 30被引用数 17
ひとこと要約

この論文は、機械学習タスクにおける経験的リスク最小化(ERM)において、計算コストが非常に高い完全U統計量の代わりに、O(n)のサンプルタプルに基づく不完全U統計量(モンテカルロ推定)を用いることを提案する。この手法は、完全U統計量のO(1/√n)の学習レートを保持しつつ、計算量を著しく削減するが、複雑さの制約下での一様偏差バウンドを用いた近似精度の理論的保証を備えている。

ABSTRACT

In a wide range of statistical learning problems such as ranking, clustering or metric learning among others, the risk is accurately estimated by $U$-statistics of degree $d\\geq 1$, i.e. functionals of the training data with low variance that take the form of averages over $k$-tuples. From a computational perspective, the calculation of such statistics is highly expensive even for a moderate sample size $n$, as it requires averaging $O(n^d)$ terms. This makes learning procedures relying on the optimization of such data functionals hardly feasible in practice. It is the major goal of this paper to show that, strikingly, such empirical risks can be replaced by drastically computationally simpler Monte-Carlo estimates based on $O(n)$ terms only, usually referred to as incomplete $U$-statistics, without damaging the $O_{\\mathbb{P}}(1/\\sqrt{n})$ learning rate of Empirical Risk Minimization (ERM) procedures. For this purpose, we establish uniform deviation results describing the error made when approximating a $U$-process by its incomplete version under appropriate complexity assumptions. Extensions to model selection, fast rate situations and various sampling techniques are also considered, as well as an application to stochastic gradient descent for ERM. Finally, numerical examples are displayed in order to provide strong empirical evidence that the approach we promote largely surpasses more naive subsampling techniques.

研究の動機と目的

  • 次数dに対してO(n^d)のスケールで増加する完全U統計量の計算コストの高い問題に対処すること。
  • O(n)のサンプルタプルに基づく不完全U統計量が、完全U統計量と同等のO(1/√n)の学習レートを維持できることを示すこと。
  • 仮説クラスの複雑さの仮定の下で、完全Uプロセスと不完全Uプロセスの近似誤差に関する一様偏差バウンドを確立すること。
  • 提案手法のサンプリング法とナーブなサブサンプリング手法を比較し、優れた性能を示すこと。
  • 不完全U統計量フレームワークを反復的最適化手法(例:確率的勾配降下法)に統合し、スケーラブルな学習を可能にすること。

提案手法

  • すべてのO(n^d)個のタプルではなく、O(n)個のランダムに選択されたdタプルから、復元抽出を用いたモンテカルロサンプリングにより不完全U統計量を構築する。
  • 不完全U統計量の分散とバイアスを分析するために、ホーフィングの分解を適用し、主成分と退化成分に分離する。
  • 完全Uプロセスと不完全Uプロセスの間の近似誤差に関する一様偏差不等式を、ベルンシュタイン型不等式を用いて導出する。
  • 仮説クラスの複雑さ(メトリックエントロピーまたはラデマッハ複雑度を用いて)に依存する、真のU統計量とその不完全バージョンとの期待偏差に関するバウンドを確立する。
  • 各ステップで不完全U統計量を用いて勾配を推定する、確率的勾配降下法(SGD)の変種を提案し、緩い仮定のもとで収束を保証する。
  • サンプリングスキーム(ベルヌーイサンプリングおよび非復元抽出)を用い、それぞれの下での近似誤差の尾部バウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1O(n)項の不完全U統計量が、完全U統計量に置き換わっても、ERMのO(1/√n)の学習レートを保持できるか?
  • RQ2完全Uプロセスの不完全な対応物による近似はどの程度正確か?一様偏差に関するバウンドを確立できるか?
  • RQ3提案されたサンプリング戦略は、統計的効率性と計算コストの面で、ナーブなサブサンプリングを上回るか?
  • RQ4不完全U統計量フレームワークは、SGDのような反復的最適化手法に効果的に統合できるか?
  • RQ5不完全U統計量を用いる場合、どの条件下で高速収束レートが維持されるか?

主な発見

  • 完全U統計量とその不完全バージョンとの間の近似誤差は、高確率で有界であり、そのバウンドはB(サンプルタプル数)に関してO(1/√B)の速度で減少する。
  • ベルヌーイサンプリングの場合、一様偏差バウンドはO(√(V log(1+|Λ|)/B))に比例し、Vは仮説クラスのメトリックエントロピーである。
  • 非復元抽出の場合は、集中性の性質が向上するため、バウンドがよりタイトになり、O(√(V/B))に比例する。
  • メトリック学習およびクラスタリングタスクにおける理論的バウンドと実験的性能の両面で、提案手法はナーブなサブサンプリング手法を上回る。
  • SGDに適用した場合、不完全U統計量による勾配推定器は、1ステップあたりO(n)の項しか使用しなくても、標準的なERMと同等のO(1/√n)の収束速度を達成する。
  • 不完全U統計量の分散は、n′個のサンプルタプルに対して漸近的にO(1/n′)である一方、完全U統計量の分散はO(1/n′²)であるため、特定の条件下で有限標本における性能が向上することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。