Skip to main content
QUICK REVIEW

[论文解读] Minimax Estimation of Discrete Distributions under $\ell_1$ Loss

Yanjun Han, Jiantao Jiao|arXiv (Cornell University)|Nov 6, 2014
Machine Learning and Algorithms参考文献 26被引用 5
一句话总结

该论文在支持大小 S 随样本量 n 增长时,为离散分布估计在 ℓ₁ 损失下建立了紧致的极小极大界。结果表明,经验分布的最大风险渐近尺度为 2H / ln n,而极小极大风险为 H / ln n,且一种硬阈值估计器在无需知晓熵界 H 的情况下即可实现极小极大性。

ABSTRACT

We analyze the problem of discrete distribution estimation under $\ell_1$ loss. We provide non-asymptotic upper and lower bounds on the maximum risk of the empirical distribution (the maximum likelihood estimator), and the minimax risk in regimes where the alphabet size $S$ may grow with the number of observations $n$. We show that among distributions with bounded entropy $H$, the asymptotic maximum risk for the empirical distribution is $2H/\ln n$, while the asymptotic minimax risk is $H/\ln n$. Moreover, Moreover, we show that a hard-thresholding estimator oblivious to the unknown upper bound $H$, is asymptotically minimax. However, if we constrain the estimates to lie in the simplex of probability distributions, then the asymptotic minimax risk is again $2H/\ln n$. We draw connections between our work and the literature on density estimation, entropy estimation, total variation distance ($\ell_1$ divergence) estimation, joint distribution estimation in stochastic processes, normal mean estimation, and adaptive estimation.

研究动机与目标

  • 表征在 ℓ₁ 损失下离散分布估计中经验分布估计器的极小极大风险与最大风险。
  • 分析当支持大小 S 随样本量 n 增长时,这些风险的渐近行为,特别是受限于有界熵的情形。
  • 识别在不知晓熵界 H 的前提下仍能实现极小极大风险的估计器,尤其在高维与无限维情形下。
  • 建立离散分布估计与相关问题(如熵估计、密度估计及随机过程)之间的联系。
  • 通过与其他损失比较,证明 ℓ₁ 损失与非参数模型的兼容性,为在分布估计中使用 ℓ₁ 损失提供理论依据。

提出的方法

  • 利用集中不等式与渐近分析,推导经验分布估计器(MLE)最大风险的上下界。
  • 应用泊松化技术将多项分布模型与泊松模型关联,通过构建条件先验实现更紧致的风险界。
  • 在具有有界 ℓ₁ 偏差于均匀分布的分布上使用条件先验,通过贝叶斯风险论证推导极小极大风险的下界。
  • 采用一种硬阈值估计器,将小的样本概率置零,证明其在不知晓 H 的前提下可渐近实现极小极大风险。
  • 应用一个一般性的渐近正态性结果(定理 6),在 i.i.d. 设置下通过费舍尔信息矩阵与得分函数的 ℓ₁ 范数推导极小极大风险的下界。
  • 比较单纯形约束(概率分布)与无约束估计下的极小极大风险,表明渐近风险从 H/ln n 增加至 2H/ln n。

实验结果

研究问题

  • RQ1当支持大小 S 随 n 增长时,在 ℓ₁ 损失下对有界熵 H 的离散分布估计,其渐近极小极大风险为何?
  • RQ2经验分布估计器的最大风险在渐近意义上如何随熵 H 与样本量 n 变化?
  • RQ3是否存在一种分布估计器可在不知晓熵界 H 的前提下实现极小极大风险?
  • RQ4将估计值约束在概率单纯形上对极小极大风险有何影响?
  • RQ5离散分布估计的结果如何与更广泛的问题(如熵估计、密度估计及随机过程)相联系?

主要发现

  • 当熵 H 有界且 n → ∞ 时,经验分布估计器的渐近最大风险为 2H / ln n。
  • 渐近极小极大风险为 H / ln n,仅为经验估计器风险的一半,表明性能存在根本性差距。
  • 一种无需知晓 H 的硬阈值估计器可渐近实现极小极大风险,使其具备自适应性与实用性。
  • 当估计器被约束在概率单纯形上时,渐近极小极大风险增加至 2H / ln n,与经验估计器风险一致。
  • 在泊松化模型下,极小极大风险被限制在 exp(−ζ²n/24) + R(S, n/(1+ζ)) + ε + δ 内,表明在适当条件下具有指数集中性。
  • 条件先验下的贝叶斯风险为极小极大风险提供了下界,且该下界在常数范围内紧致,证实了渐近速率的正确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。