Skip to main content
QUICK REVIEW

[論文レビュー] On Empirical Risk Minimization with Dependent and Heavy-Tailed Data

Abhishek Roy, Krishnakumar Balasubramanian|arXiv (Cornell University)|Sep 6, 2021
Statistical Methods and Inference参考文献 32被引用数 4
ひとこと要約

本稿は、Mendelsonの『集中なしの学習』フレームワークを厳密に stationarity で、指数的β-混合過程へ一般化することで、従属的かつ重尾なデータに対する経験的リスク最小化(ERM)を拡張する。ノイズと関数評価の相互作用を直接モデル化することにより、弱いモーメント仮定の下で、多変量線形回帰の二乗損失およびHuber損失における収束速度を導出する。

ABSTRACT

In this work, we establish risk bounds for the Empirical Risk Minimization (ERM) with both dependent and heavy-tailed data-generating processes. We do so by extending the seminal works of Mendelson [Men15, Men18] on the analysis of ERM with heavy-tailed but independent and identically distributed observations, to the strictly stationary exponentially $β$-mixing case. Our analysis is based on explicitly controlling the multiplier process arising from the interaction between the noise and the function evaluations on inputs. It allows for the interaction to be even polynomially heavy-tailed, which covers a significantly large class of heavy-tailed models beyond what is analyzed in the learning theory literature. We illustrate our results by deriving rates of convergence for the high-dimensional linear regression problem with dependent and heavy-tailed data.

研究の動機と目的

  • 従属的かつ重尾なデータ生成過程(DGP)におけるERM分析の理論的ギャップを埋めること。実務では一般的であるが、学習理論では十分に理解されていない。
  • 元々i.i.d.な重尾データを想定していたMendelsonの『集中なしの学習』フレームワークを、厳密に stationarity で、指数的β-混合DGPへの非i.i.d.拡張を行うこと。
  • ノイズと入力の相互作用が多項式的または指数的重尾である場合に、凸かつ局所的に強い強凸性を持つ損失関数のリスクバウンドを導出すること。
  • 従属的・重尾なデータにおける二乗損失およびHuber損失の両方の下で、多変量線形回帰の収束速度を提供すること。
  • 弱いモーメント条件の下で、乗数過程を扱うβ-混合確率変数に対する新しい集中不等式を開発すること。

提案手法

  • ノイズと関数評価の相互作用にモーメント条件を直接仮定することで、Mendelson(2015, 2018)の小球技法をβ-混合過程へ拡張する。
  • 指数的重尾な相互作用には[MPr11]の集中不等式を用い、多項式的重尾な相互作用については[BMdlP20]を拡張して、β-混合設定における新しい不等式を導出する。
  • 乗数経験過程を解析する際、ノイズと入力における関数評価の相互作用項を明示的に制御することで、一様集中に依存しない。
  • ℓ1-およびℓ2-ボールで定義される関数クラスを用いて、複雑さの測度ωQ(F−F,N,ζ1,ζ2)を用いて推定誤差をバウンドする多変量線形モデルにフレームワークを適用する。
  • Corollary B.2を用いて一般化誤差バウンドを導出し、β-混合仮定の下で尾確率バウンドと複雑さ制御を組み合わせる。
  • リスクバウンドにおける3つの項(高速率項、低速率項、Nに従って減少する項)のバランスを取ることで収束速度を確立する。適切にA(N)を選択することで、β-混合依存性に起因する第3項をN→∞で0に収束させ、高速率を達成可能にする。

実験結果

リサーチクエスチョン

  • RQ1i.i.d.仮定が成り立たない従属的・重尾なデータに対して、ERMが理論的に正当化可能か?
  • RQ2弱いモーメント仮定の下で、乗数経験過程の不等式をβ-混合過程へどのように拡張できるか?
  • RQ3データが従属的かつ重尾な場合に、二乗損失およびHuber損失の下で多変量線形回帰の収束速度はどの程度達成可能か?
  • RQ4一様集中や有界性仮定に依存せずに、『集中なしの学習』フレームワークを非i.i.d.設定に適応可能か?
  • RQ5ノイズと関数評価の積における多項式的・指数的重尾性の違いが、一般化誤差に与える影響は何か?

主な発見

  • 本稿は、β-混合、重尾データにおけるERMの一般リスクバウンドを確立し、ℓ2推定誤差の収束速度がmax(N^{-1/2+ι}, R/√N √log(ed/N))のオーダーであることを示す。
  • ℓ1正則化関数クラスを用いた多変量線形モデルでは、N ≤ c1(Lg)d のとき推定誤差がO(R/√N √log(ed/N))でバウンドされ、N > c1(Lg)d のときはO(R/√d)でバウンドされる。
  • 一般化誤差バウンドは高確率で成立し、失敗確率がexp(−cN^{η1/(1+η1)})およびexp(−(N^{2ι}τ0)^η/M1)のオーダーで減少することで、強い集中性を示す。
  • 古典的ERMよりも弱いモーメント仮定の下で非漸近的リスクバウンドを達成し、ノイズと入力の間の多項式的または指数的重尾な相互作用を許容する。
  • リスクバウンドにおける第3項(β-混合依存性に起因)は、A(N)を適切に選択することで、N→∞で0に収束させられ、高速率が達成可能であることが示された。
  • スパース線形回帰の文脈で、二乗損失およびHuber損失の両方において結果を検証し、依存性と重尾ノイズの下でもロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。