[论文解读] Trimming the Hill estimator: robustness, optimality and adaptivity
本文提出了一种鲁棒的、最优加权的截断Hill估计量,用于重尾分布,通过排除最极端的顺序统计量来减轻污染影响。该方法在帕累托模型下实现有限样本效率,在二阶条件下保证渐近正态性,并提出一种基于截断Hill图和序列检验的数据驱动截断程序,实现对未知污染水平的自适应性,同时识别极端异常值。
We introduce a trimmed version of the Hill estimator for the index of a heavy-tailed distribution, which is robust to perturbations in the extreme order statistics. In the ideal Pareto setting, the estimator is essentially finite-sample efficient among all unbiased estimators with a given strict upper break-down point. For general heavy-tailed models, we establish the asymptotic normality of the estimator under second order conditions and discuss its minimax optimal rate in the Hall class. We introduce the so-called trimmed Hill plot, which can be used to select the number of top order statistics to trim. We also develop an automatic, data-driven procedure for the choice of trimming. This results in a new type of robust estimator that can {\em adapt} to the unknown level of contamination in the extremes. As a by-product we also obtain a methodology for identifying extreme outliers in heavy tailed data. The competitive performance of the trimmed Hill and adaptive trimmed Hill estimators is illustrated with simulations.
研究动机与目标
- 解决在极端值污染存在下,缺乏鲁棒、最优且自适应的尾指数估计的问题。
- 开发一种截断Hill估计量,在理想帕累托模型下保持有限样本效率,同时对顶部顺序统计量的扰动具有鲁棒性。
- 在第二阶正则变异性条件下,建立截断估计量的渐近正态性和极小极大最优性。
- 提出一种基于截断Hill图和序列检验的数据驱动方法,用于选择截断参数 $k_0$。
- 实现对极端值中未知污染水平的自动适应,并检测极端异常值。
提出的方法
- 提出加权截断Hill估计量 $\widehat{\xi}^{\rm trim}_{k_0,k}(n) = \sum_{i=k_0+1}^{k} c_{k_0,k}(i) \log\left(\frac{X_{(n-i+1,n)}}{X_{(n-k,n)}}\right)$,其中最优权重 $c_{k_0,k}(i)$ 在帕累托模型下作为最佳线性无偏估计量推导得出。
- 通过极端顺序统计量对数比值的协方差矩阵的逆矩阵推导最优权重 $c_{k_0,k}(i)$,确保在固定上界崩溃点的无偏估计量中实现有限样本效率。
- 引入截断Hill图为可视化工具,通过在固定 $k$ 下绘制不同 $k_0$ 值的截断估计量,指导截断参数 $k_0$ 的选择。
- 开发加权序列检验程序,通过检验截断估计量加权比值中的结构突变,自动选择 $k_0$,并利用最优截断估计量的联合渐近分布。
- 利用截断估计量的渐近联合分布构造检验统计量,检测极端顺序统计量中的异常,实现异常值检测。
- 在霍尔类中建立截断估计量的极小极大率最优性,并在缓慢变化函数 $\ell(x)$ 的二阶条件下证明其渐近正态性。
实验结果
研究问题
- RQ1能否构造Hill估计量的截断版本,在帕累托模型下,使所有具有固定强上界崩溃点的无偏估计量中实现有限样本效率?
- RQ2当 $k_0 = o(k)$ 时,如何使截断Hill估计量保持与经典Hill估计量相同的收敛速率?
- RQ3在霍尔类重尾分布中,截断Hill估计量的极小极大最优收敛速率是多少?
- RQ4能否开发一种无需预先知晓污染水平的数据驱动、自动选择截断参数 $k_0$ 的程序?
- RQ5截断估计量能否用于检测和识别重尾数据中的极端异常值?
主要发现
- 所提出的截断Hill估计量在帕累托模型下,对所有具有固定强上界崩溃点的无偏估计量实现了有限样本效率。
- 只要 $k_0 = o(k)$,该估计量就保持与经典Hill估计量相同的收敛速率,确保在温和条件下不损失效率。
- 在霍尔类重尾分布中,截断Hill估计量达到极小极大率最优,匹配尾指数估计的最优收敛速率。
- 截断Hill图能有效可视化估计量在不同 $k_0$ 值下的稳定性,有助于截断参数的选择。
- 所提出的 $k_0$ 选择序列检验程序具有渐近有效性,且满足 $k^\delta \max_{0 \leq k_0 < h(k)} |T_{k_0,k} - T^*_{k_0,k}| \stackrel{P}{\to} 0$,证实了数据驱动截断选择的一致性。
- 该方法通过模拟成功识别出重尾数据中的极端异常值,检测到顶部顺序统计量中具有统计显著性的偏离。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。