Skip to main content
QUICK REVIEW

[论文解读] Estimating a structural distribution function by grouping

Bert van Es, Stamatis Kolios|ArXiv.org|Mar 8, 2002
Bayesian Methods and Mixture Models参考文献 3被引用 6
一句话总结

本文研究在样本量和罕见事件规模均增长的渐近情形下,结构分布函数的一致估计问题,其中文本长度和词汇量均按比例增长。通过泊松化(Poissonization)与将单元格分组为等大小的箱(bins),证明了在样本量与组数之比满足特定条件时,分组估计量是弱一致的,从而解决了自然估计量的不一致性问题。

ABSTRACT

By the method of Poissonization we confirm some existing results concerning consistent estimation of the structural distribution function in the situation of a large number of rare events. Inconsistency of the so called natural estimator is proved. The method of grouping in cells of equal size is investigated and its consistency derived. A bound on the mean squared error is derived.

研究动机与目标

  • 解决大规模、罕见事件设置下结构分布函数自然经验估计量的不一致性问题。
  • 研究在渐近条件下,将单元格分组为等大小箱是否能恢复估计的一致性。
  • 建立分组估计量以概率收敛于真实极限分布函数的理论条件。
  • 利用泊松化与特征函数技术,提供一致性的严格证明。
  • 推导分组估计量的均方误差界,以量化估计精度。

提出的方法

  • 应用泊松化将多项分布单元格计数转化为独立的泊松随机变量,简化依赖结构。
  • 通过将相邻单元格聚合为 m 个大小相等的箱(每个箱大小为 k = M/m),定义分组后的单元格概率与频数。
  • 基于缩放后的分组计数 (m/n)ν̄_j,M 构造分组经验分布函数估计量 F̂_m(x)。
  • 利用特征函数收敛性与 Helly-Bray 定理,证明泊松化估计量弱收敛于真实分布。
  • 通过在高概率事件 A_n 上控制泊松化估计量与原始估计量之间的差异,建立均方误差的界。
  • 利用分组值之间相距 O(1/m) 的事实,控制小区间内的概率质量,从而实现误差控制。

实验结果

研究问题

  • RQ1为何在大样本、罕见事件情形下,结构分布函数的自然估计量不一致?
  • RQ2在何种条件下,将单元格分组为等大小箱可恢复结构分布函数估计量的一致性?
  • RQ3泊松化如何简化分组估计量极限行为的分析?
  • RQ4分组估计量收敛于真实极限分布函数的速率是多少?
  • RQ5在给定渐近条件下,能否为分组估计量推导出均方误差的界?

主要发现

  • 自然估计量 F̂_M(x) 是不一致的,且以概率收敛于一个极限分布 F_Y/λ(x),该分布并非真实的 F(x),其原因是 M/n 的倍数处存在离散跳跃。
  • 在条件 n/(m log m) → ∞(当 n, m → ∞ 时)下,分组估计量 F̂_m(x) 对 F(x) 是弱一致的。
  • 当 M → ∞ 时,|F_M(x) - F_m(x)| 趋于零,意味着分组分布函数 F_m 收敛于与 F_M 相同的极限 F。
  • 分组估计量的均方误差被界为 O(δ_n²) + O(1/m²),其中 δ_n = (m/n)^{1/2 - α},在给定条件下趋于零。
  • 证明依赖于在高概率事件 A_n 上控制泊松化估计量与原始估计量之间的差异,且满足 P(A_n^c) ≤ 1/m²。
  • 通过一致可积性与 Helly-Bray 定理,建立了泊松化估计量特征函数收敛于 F(x) 特征函数的结论。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。