Skip to main content
QUICK REVIEW

[論文レビュー] Robust Kernel Density Estimation with Median-of-Means principle

Pierre Humbert, Batiste Le Bars|arXiv (Cornell University)|Jun 30, 2020
Adversarial Robustness in Machine Learning参考文献 35被引用数 8
ひとこと要約

本稿では、中間値の平均の原理を組み合わせたロバストなカーネル密度推定器であるMoM-KDEを提案する。この手法は、一般の外れ値フレームワーク($ olimits\mathcal{O}\cup\mathcal{I}$)下で、$L_\infty$-ノルムにおける高確率有限標本誤差バウンドと$L_1$-一貫性を達成する。外れ値が存在しない場合の標準的KDEと同等の収束速度を達成するとともに、既存のロバスト推定器よりも計算複雑性が低い。

ABSTRACT

In this paper, we introduce a robust nonparametric density estimator combining the popular Kernel Density Estimation method and the Median-of-Means principle (MoM-KDE). This estimator is shown to achieve robustness to any kind of anomalous data, even in the case of adversarial contamination. In particular, while previous works only prove consistency results under known contamination model, this work provides finite-sample high-probability error-bounds without a priori knowledge on the outliers. Finally, when compared with other robust kernel estimators, we show that MoM-KDE achieves competitive results while having significant lower computational complexity.

研究の動機と目的

  • 任意の外れ値汚染下でも統計的性能を維持するロバストな非パラメトリック密度推定器の開発。
  • 外れ値分布や汚染度の事前知識なしに、$L_\infty$-ノルムにおける有限標本の高確率誤差バウンドを提供すること。
  • 外れ値分布に関する仮定を必要としない一般の$\mathcal{O}\cup\mathcal{I}$外れ値モデル下で、$L_1$-一貫性を達成すること。
  • RKDE や SPKDE のような反復的ロバストKDE手法と比較して、計算複雑性を低減すること。
  • 合成データおよび実世界のデータセットを用いた、外れ値の割合や汚染パターンを変化させた状況での実験的検証。

提案手法

  • データを重複のないブロックに分割し、各ブロックに対して固定帯域幅を用いてKDEを計算する。
  • その後、ブロックごとのKDEに座標ごとの中央値を適用して、最終的なMoM-KDE推定器を構築する。
  • 中央値の平均の原理を用いることで、ブロック推定値における極端な値への感受性を低減し、外れ値に対してロバストになる。
  • 理論的分析は、濃縮不等式と、$ olimits\mathcal{O}\cup\mathcal{I}$フレームワークに依存しており、外れ値($ olimits\mathcal{O}$)とインライナー($ olimits\mathcal{I}$)を分離するが、$ olimits\mathcal{O}$の分布的仮定を必要としない。
  • 帯域幅は交差検証や他の標準的手法により選択され、収束速度に関する理論的保証が与えられる。
  • 反復的最適化を避けるため、RKDE や SPKDE と比較して計算が効率的である。

実験結果

リサーチクエスチョン

  • RQ1既知の汚染モデルを仮定せずに、任意の外れ値汚染に対して耐性を持つカーネル密度推定器を構築できるか?
  • RQ2KDEに中間値の平均の原理を適用することで、$L_\infty$-ノルムにおける有限標本の高確率誤差バウンドが得られるか?
  • RQ3MoM-KDEは外れ値が存在する状況でも、標準的KDEと同等の収束速度を達成できるか?
  • RQ4一般の$\mathcal{O}\cup\mathcal{I}$フレームワーク下で、MoM-KDEは$L_1$-ノルムにおいて一貫性を示せるか?
  • RQ5RKDE や SPKDE と比較して、MoM-KDEの計算複雑性と実験的性能はどのように異なるか?

主な発見

  • MoM-KDEは、外れ値分布や汚染度の事前知識なしに、$\mathcal{O}\cup\mathcal{I}$フレームワーク下で、$L_\infty$-ノルムにおける有限標本の高確率誤差バウンドを達成する。
  • 外れ値が存在しない場合のMoM-KDEの収束速度は、標準的KDEと同一であり、最適な統計的性能を示す。
  • MoM-KDEは$\mathcal{O}\cup\mathcal{I}$モデル下で$L_1$-一貫性を示し、汚染があっても全体的な推定精度を保つ。
  • 実験的結果では、特に外れ値が高密度領域に集中する悪意のある汚染下において、MoM-KDEはRKDE や SPKDE を上回る異常検知性能を示す。
  • 高次元データセット(例:Digits, $d=64$)においても、MoM-KDEは強力な性能を維持するが、競合手法は性能を低下させるため、次元への耐性があることが示された。
  • RKDE や SPKDE のような反復的ロバスト推定器と比較して、MoM-KDEは計算複雑性が低く、より大規模なデータセットにもスケーラブルである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。