Skip to main content
QUICK REVIEW

[论文解读] Unbiased Estimators for Entropy and Class Number

Stephen Montgomery-Smith, Thomas Schürmann|arXiv (Cornell University)|Oct 18, 2014
Face and Expression Recognition参考文献 4被引用 7
一句话总结

本文在任意长度独立采样设置下,提出了香农熵和类别数的新型无偏估计量。提出了两种基于互返时间与调和数的熵估计量,以及两种基于精确概率推导(利用几何级数与调和级数恒等式)的无偏类别数估计量,全部实现零偏差。

ABSTRACT

We introduce unbiased estimators for the Shannon entropy and the class number, in the situation that we are able to take sequences of independent samples of arbitrary length.

研究动机与目标

  • 当从已知类别的无限总体中采样时,开发香农熵的无偏估计量。
  • 解决传统熵估计量系统性低估真实熵的已知偏差问题。
  • 提出类别数 $ M $ 的无偏估计量,适用于生态学与信息论应用。
  • 提供理论严谨的估计量,即使在方差较高、未进行平均的情况下也能实现零偏差。
  • 扩展框架以应对实际数据采集,提出基于多个起始点与样本重排的估计量。

提出的方法

  • 提出估计量 $\hat{H}_1 = \sum_{i=1}^M \frac{I_{N_i \geq 2}}{N_i - 1}$,其中 $N_i$ 为首次到达类别 $C_i$ 的首达时间,利用几何分布性质。
  • 引入 $\hat{H}_2 = h_{N-1}$,其中 $N$ 是满足 $w_1$ 与 $w_{k+1}$ 属于同一类的最小 $k \geq 1$,利用恒等式 $\mathbb{E}[h_{N-1} \mid w_1 \in C_i] = -\log p_i$。
  • 通过平均 $n$ 个此类估计量降低方差:$\hat{H}_3 = \frac{1}{n} \sum_{j=1}^n h_{N^{(j)}-1}$,其中 $N^{(j)}$ 由 $w_j$ 与 $w_{k+j}$ 定义。
  • 提出 $\hat{M}_1 = N$ 作为类别数 $M$ 的无偏估计量,源自相同的返程时间分布。
  • 提出 $\hat{M}_2 = \frac{1}{n} \sum_{j=1}^n N^{(j)}$ 作为使用多个起始点的改进类别数估计量。
  • 推导出基于校正的估计量 $\hat{M}_4 = \hat{M}_3 + \frac{1}{n} \sum_{i \in A} \left( \frac{m+1}{s_i+1} - \frac{n+1}{r_i+1} \right)$,用于样本顺序未被保留的情况。

实验结果

研究问题

  • RQ1当可获得任意长度的独立同分布样本时,能否构建香农熵的无偏估计量?
  • RQ2如何通过精确的概率建模消除经典熵估计量中的已知偏差?
  • RQ3能否利用返程时间构造一个无偏估计量来估计总体中不同类别的数量 $M$?
  • RQ4方差对无偏估计量实际可用性的影响是什么?如何缓解这一问题?
  • RQ5无偏估计量能否适应现实世界的数据采集场景,其中样本顺序未被追踪?

主要发现

  • 估计量 $\hat{H}_1 = \sum_{i=1}^M \frac{I_{N_i \geq 2}}{N_i - 1}$ 对香农熵严格无偏,满足 $\mathbb{E}[\hat{H}_1] = -\sum_{i=1}^M p_i \log p_i$。
  • 估计量 $\hat{H}_2 = h_{N-1}$ 对熵无偏,源于恒等式 $\mathbb{E}[h_{N-1} \mid w_1 \in C_i] = -\log p_i$,由此得到总期望 $\mathbb{E}[\hat{H}_2] = H$。
  • 通过 $\hat{H}_3 = \frac{1}{n} \sum_{j=1}^n h_{N^{(j)}-1}$ 平均 $n$ 个此类估计量可降低方差,尽管在未进一步分析的情况下置信区间仍较宽。
  • 估计量 $\hat{M}_1 = N$ 对类别数 $M$ 无偏,其中 $N$ 为 $w_1$ 返至其自身类别的首次返程时间。
  • 估计量 $\hat{M}_2 = \frac{1}{n} \sum_{j=1}^n N^{(j)}$ 使用多个起始点,提供一致且无偏的 $M$ 估计。
  • 基于校正的估计量 $\hat{M}_4 = \hat{M}_3 + \frac{1}{n} \sum_{i \in A} \left( \frac{m+1}{s_i+1} - \frac{n+1}{r_i+1} \right)$ 允许在样本顺序未被保留时实现无偏估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。