Skip to main content
QUICK REVIEW

[论文解读] Robust Kernel Density Estimation with Median-of-Means principle

Pierre Humbert, Batiste Le Bars|arXiv (Cornell University)|Jun 30, 2020
Adversarial Robustness in Machine Learning参考文献 35被引用 8
一句话总结

本文提出 MoM-KDE,一种鲁棒核密度估计器,通过将核密度估计与中位数-均值原理相结合,在一般异常值框架($\mathcal{O}\cup\mathcal{I}$)下实现 $L_∞$-范数的高概率有限样本误差界以及 $L_1$-一致性。该方法在无异常值时达到与标准 KDE 相同的收敛速率,同时计算复杂度低于现有鲁棒估计器。

ABSTRACT

In this paper, we introduce a robust nonparametric density estimator combining the popular Kernel Density Estimation method and the Median-of-Means principle (MoM-KDE). This estimator is shown to achieve robustness to any kind of anomalous data, even in the case of adversarial contamination. In particular, while previous works only prove consistency results under known contamination model, this work provides finite-sample high-probability error-bounds without a priori knowledge on the outliers. Finally, when compared with other robust kernel estimators, we show that MoM-KDE achieves competitive results while having significant lower computational complexity.

研究动机与目标

  • 开发一种鲁棒的非参数密度估计器,在任意异常值污染下保持统计性能。
  • 在不假设异常值分布或污染水平的前提下,提供 $L_\infty$-范数的有限样本高概率误差界。
  • 在一般 $\mathcal{O}\cup\mathcal{I}$ 异常值模型下实现 $L_1$-一致性,且无需对异常值分布做假设。
  • 相比如 RKDE 和 SPKDE 等迭代鲁棒 KDE 方法,降低计算复杂度。
  • 在不同异常值比例和污染模式下,通过合成数据集和真实世界数据集的实证验证方法性能。

提出的方法

  • 将数据划分为非重叠的块,并对每个块使用固定带宽计算 KDE。
  • 然后对各块 KDE 的坐标逐项取中位数,形成最终的 MoM-KDE 估计器。
  • 该估计器利用中位数-均值原理降低对异常值的敏感性,因为中位数对块估计中的极端值具有鲁棒性。
  • 理论分析依赖于集中不等式和 $\mathcal{O}\cup\mathcal{I}$ 框架,该框架将内点($\mathcal{I}$)与异常值($\mathcal{O}$)分离,且不对 $\mathcal{O}$ 做分布假设。
  • 带宽通过交叉验证或其他标准方法选择,并具备收敛速率的理论保证。
  • 该方法计算效率高,因其避免了迭代优化,与 RKDE 和 SPKDE 不同。

实验结果

研究问题

  • RQ1能否在不假设已知污染模型的前提下,使核密度估计器对任意异常值污染具有鲁棒性?
  • RQ2应用于 KDE 的中位数-均值原理是否能产生 $L_\infty$-范数的有限样本高概率误差界?
  • RQ3MoM-KDE 在存在异常值时能否达到与标准 KDE 相同的收敛速率?
  • RQ4在一般 $\mathcal{O}\cup\mathcal{I}$ 框架下,MoM-KDE 是否在 $L_1$-范数下保持一致性?
  • RQ5与 RKDE 和 SPKDE 相比,MoM-KDE 在计算复杂度和实证性能方面表现如何?

主要发现

  • MoM-KDE 在 $\mathcal{O}\cup\mathcal{I}$ 框架下实现了 $L_\infty$-范数的有限样本高概率误差界,且无需事先了解异常值分布或污染水平。
  • MoM-KDE 的收敛速率与无异常值时的标准 KDE 一致,表明其具有最优的统计性能。
  • 在 $\mathcal{O}\cup\mathcal{I}$ 模型下,MoM-KDE 具备 $L_1$-一致性,表明其在污染条件下仍能实现全局估计精度。
  • 实证结果表明,MoM-KDE 在异常值检测任务中优于 RKDE 和 SPKDE,尤其在对抗性污染(异常值集中于高密度区域)时表现更优。
  • MoM-KDE 在高维数据集(如 Digits,$d=64$)中保持强性能,而竞争对手性能下降,表明其对维度具有鲁棒性。
  • 与 RKDE 和 SPKDE 等迭代鲁棒估计器相比,MoM-KDE 具有更低的计算复杂度,使其可扩展至更大规模数据集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。