[论文解读] Estimating Mutual Information by Local Gaussian Approximation
本文提出了一种新颖的半参数互信息估计器,通过在每个样本点处使用局部高斯分布近似概率密度,显著提升了强依赖变量的估计精度。该方法渐近无偏,且在样本有限的强依赖场景下,优于现有的基于kNN的估计器。
Estimating mutual information (MI) from samples is a fundamental problem in statistics, machine learning, and data analysis. Recently it was shown that a popular class of non-parametric MI estimators perform very poorly for strongly dependent variables and have sample complexity that scales exponentially with the true MI. This undesired behavior was attributed to the reliance of those estimators on local uniformity of the underlying (and unknown) probability density function. Here we present a novel semi-parametric estimator of mutual information, where at each sample point, densities are {\em locally} approximated by a Gaussians distribution. We demonstrate that the estimator is asymptotically unbiased. We also show that the proposed estimator has a superior performance compared to several baselines, and is able to accurately measure relationship strengths over many orders of magnitude.
研究动机与目标
- 解决现有非参数互信息估计器在强依赖变量下表现不佳的问题。
- 克服基于kNN的估计器因局部均匀性假设而带来的样本复杂度问题。
- 开发一种具有可证明渐近无偏性的半参数估计器,并实现优越的实证性能。
- 为互信息估计提供一种理论基础扎实的替代方案,以替代现有的启发式校正方法。
提出的方法
- 在每个样本点处,利用局部似然估计方法,用高斯分布近似局部密度。
- 该方法通过最小化真实密度与局部高斯近似之间的Kullback-Leibler散度来实现。
- 利用拟合的局部高斯分布的参数来估计熵和互信息。
- 该方法利用局部似然密度估计的既有成果,以处理边界偏差和非均匀性问题。
- 在底层密度满足标准正则性条件下,该估计器被构造为渐近无偏。
- 带宽选择至关重要,通过自适应优化实现,以保持局部高斯结构的稳定性。
实验结果
研究问题
- RQ1局部高斯近似是否能提升在kNN方法失效的强依赖变量上的互信息估计性能?
- RQ2所提出的估计器在标准正则性条件下是否具有渐近无偏性?
- RQ3在不同依赖强度下,局部高斯估计器与基线kNN及校正估计器的性能表现如何比较?
- RQ4局部非均匀性对传统非参数MI估计器有何影响?是否可系统性地加以校正?
- RQ5能否为互信息估计中基于局部密度近似的方案建立理论性能保证?
主要发现
- 所提出的局部高斯近似估计器具有渐近无偏性,提供了坚实的理论基础。
- 在强依赖场景下,该估计器显著优于基于kNN的基线方法,后者在强依赖下面临指数级样本复杂度问题。
- 实证结果表明,该方法可在依赖强度的多个数量级范围内实现精确的互信息测量。
- 该方法有效缓解了传统非参数密度估计器普遍存在的边界偏差与非均匀性问题。
- 该估计器在弱依赖场景下保持了良好性能,同时在高依赖场景下表现尤为出色。
- 该方法在理论上优于kpN估计器(Lombardi and Pant, 2015),后者虽使用截断高斯分布,但缺乏正式的性能保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。