Skip to main content
QUICK REVIEW

[论文解读] Outliers and related problems

Lev B. Klebanov, Jaromı́r Antoch|arXiv (Cornell University)|Jan 23, 2017
Statistical Distribution Estimation and Applications参考文献 4被引用 4
一句话总结

本文将异常值重新定义为与特定统计模型矛盾的观测值,提出一种对模型敏感的框架,将异常值与重尾分布及大数定律失效联系起来。通过基于样本均值和样本方差的极端偏离,提出了一种严格的概率定义,表明此类异常值自然地出现在稳定分布和帕累托分布中,为模型改进而非剔除提供了路径。

ABSTRACT

We define outliers as a set of observations which contradicts the proposed mathematical (statistical) model and we discuss the frequently observed types of the outliers. Further we explore what changes in the model have to be made in order to avoid the occurance of the outliers. We observe that some variants of the outliers lead to classical results in probability, such as the law of large numbers and the concept of heavy tailed distributions. Key words: outlier; the law of large numbers; heavy tailed distributions; model rejection.

研究动机与目标

  • 解决传统异常值定义中‘远离’观测值的模糊性和不精确性。
  • 基于统计矛盾,建立数学上严格、依赖于模型的异常值定义。
  • 探讨异常值的存在如何揭示参数模型的缺陷,并提示模型修正。
  • 将异常值的出现与重尾分布和大数定律失效等基本概率现象联系起来。

提出的方法

  • 将异常值正式定义为在给定模型下概率极低的观测值,引入小非零概率的β-异常值概念。
  • 利用经验均值和样本方差,通过标准化偏离 |X - x̄|/s_n > k 定义‘远离’的观测值。
  • 应用极值理论和正规变体分析顺序统计量(特别是 X_(n) 和 X_(n-1))的渐近行为,以表征重尾行为。
  • 推导出一个刻画定理:当且仅当分布为形状参数为 α 的帕累托分布时,对所有 n 和 κ ∈ (0,1),有 P(X_(n-1) ≤ κX_(n)) = κ^α。
  • 通过凸包体积或成对距离等标量特征,将多变量异常值检测简化为单变量问题。
  • 利用密度函数的正规变体概念识别多峰结构,并将多峰异常值定义为相对于各峰的首类异常值。

实验结果

研究问题

  • RQ1如何形式化地定义‘异常值’,以避免模糊性及对主观距离度量的依赖?
  • RQ2异常值在经验数据中出现的数学与统计机制是什么?
  • RQ3异常值如何与经典概率定律(如大数定律)的失效相关联?
  • RQ4异常值的存在是否可用于推断真实底层分布(如重尾或稳定分布)?
  • RQ5在多变量数据中,多变量异常值在多大程度上可通过几何或分布特征简化为单变量异常值检测?

主要发现

  • 将异常值定义为与统计模型矛盾的观测值时,其本身并非固有错误,而可能表明模型误设,尤其在重尾或稳定分布情况下。
  • 当 P(|X - x̄|/s_n > k) 高于正态分布下的概率时,表明存在首类异常值,这与重尾行为相关。
  • 当 α ∈ (0,1) 时,大数定律失效,因为最大顺序统计量 X_(n) 无法被较小观测值补偿,导致样本均值发散。
  • 对所有 n 和 κ ∈ (0,1),条件 P(X_(n-1) ≤ κX_(n)) = κ^α 成立,当且仅当分布为形状参数 α 的帕累托分布,为重尾行为提供了统计检验方法。
  • 在多峰分布中,可通过将每个峰视为中心,并对 |X - a_j| 应用首类异常值标准,检测出多个非正态行为点。
  • 在多变量数据中使用凸包体积或成对距离,可将异常值检测简化为单变量问题,同时保留本文的核心框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。