Skip to main content
QUICK REVIEW

[论文解读] Information Theory in Density Destructors

J. Emmanuel Johnson, Valero Laparra|arXiv (Cornell University)|Dec 2, 2020
Neural Networks and Applications参考文献 20被引用 6
一句话总结

本文建立了一种新型连接,将密度破坏器——可微分、可逆变换,用于将复杂多变量概率分布映射至最大熵形式——与经典信息论联系起来。通过利用鲁棒块独立高斯化(RBIG)进行多变量高斯化,该方法实现了对总相关性和互信息的精确估计,在高达50维的模拟多变量t分布中,其性能优于现有技术。

ABSTRACT

Density destructors are differentiable and invertible transforms that map multivariate PDFs of arbitrary structure (low entropy) into non-structured PDFs (maximum entropy). Multivariate Gaussianization and multivariate equalization are specific examples of this family, which break down the complexity of the original PDF through a set of elementary transforms that progressively remove the structure of the data. We demonstrate how this property of density destructive flows is connected to classical information theory, and how density destructors can be used to get more accurate estimates of information theoretic quantities. Experiments with total correlation and mutual information inmultivariate sets illustrate the ability of density destructors compared to competing methods. These results suggest that information theoretic measures may be an alternative optimization criteria when learning density destructive flows.

研究动机与目标

  • 建立密度破坏器与经典信息论之间的理论与实践联系。
  • 开发一种基于可逆、可微分变换的估计信息论量(如总相关性和互信息)的方法。
  • 证明密度破坏器可作为现有估计器在高维设置下的稳健替代方案。
  • 评估基于RBIG的密度破坏器在信息论估计方面相较于最先进方法的性能。

提出的方法

  • 该方法采用密度破坏器,具体为RBIG算法,通过迭代边缘高斯化和正交旋转(如PCA)将多变量数据转换为标准正态或均匀基分布。
  • 该变换是可逆且可微分的,可通过变量变换公式精确计算似然。
  • 总相关性(T)通过各层冗余减少的累积量进行估计,收敛性通过ΔT的累积和进行跟踪。
  • 该方法利用破坏器的雅可比行列式计算数据在基分布下的似然。
  • 框架采用总相关性作为优化标准进行训练,遵循Laparra等人(2011)的停止规则。
  • 使用ITE-Toolbox对多变量t分布上的kNN、expF和vME估计器进行比较评估。

实验结果

研究问题

  • RQ1能否正式建立密度破坏器与经典信息论概念(如总相关性和互信息)之间的联系?
  • RQ2基于多变量高斯化(RBIG)的密度破坏器能否比竞争方法更准确地估计信息论量?
  • RQ3将总相关性作为优化标准是否能提升密度破坏器在估计多变量依赖关系方面的性能?
  • RQ4在高维设置下(d=3,10,50),不同自由度(ν=2,3)时,基于RBIG的密度破坏器表现如何?

主要发现

  • 在所有测试维度和自由度下,基于RBIG的密度破坏器在估计总相关性(T)方面始终优于kNN、expF和vME估计器。
  • 在所有配置中,RBIG方法在估计互信息(I)时均达到最佳或接近最佳结果,与解析值偏差极小。
  • 在同心圆玩具示例中,该方法成功将总相关性降至接近零,表明有效消除了冗余信息。
  • 各层累积的ΔT收敛至零,证实该流成功消除了数据中的所有统计依赖性。
  • 该方法在不同样本量(500至50,000)和高维设置(最高d=50)下表现出稳健性。
  • 使用总相关性作为优化标准有效促进了密度破坏器的学习,验证了其作为训练目标的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。