Skip to main content
QUICK REVIEW

[论文解读] Mutual Information Gradient Estimation for Representation Learning

Liangjian Wen, Yiji Zhou|arXiv (Cornell University)|May 3, 2020
Domain Adaptation and Few-Shot Learning参考文献 46被引用 7
一句话总结

该论文提出了一种新型互信息梯度估计器(MIGE),用于在高维和大互信息(MI)设置下实现低方差、高精度的互信息(MI)梯度估计。通过利用隐式分布的得分估计方法,MIGE 在表示学习中实现了稳定训练,相较于现有 MI 估计器,在 InfoMax 和信息瓶颈(Information Bottleneck)框架下的性能显著提升。

ABSTRACT

Mutual Information (MI) plays an important role in representation learning. However, MI is unfortunately intractable in continuous and high-dimensional settings. Recent advances establish tractable and scalable MI estimators to discover useful representation. However, most of the existing methods are not capable of providing an accurate estimation of MI with low-variance when the MI is large. We argue that directly estimating the gradients of MI is more appealing for representation learning than estimating MI in itself. To this end, we propose the Mutual Information Gradient Estimator (MIGE) for representation learning based on the score estimation of implicit distributions. MIGE exhibits a tight and smooth gradient estimation of MI in the high-dimensional and large-MI settings. We expand the applications of MIGE in both unsupervised learning of deep representations based on InfoMax and the Information Bottleneck method. Experimental results have indicated significant performance improvement in learning useful representation.

研究动机与目标

  • 解决现有互信息(MI)估计器在互信息较大且小批量设置下出现的不稳定性和高方差问题。
  • 通过直接估计 MI 的梯度而非估计 MI 本身,改进表示学习。
  • 在无监督表示学习和信息瓶颈方法中实现稳定且准确的训练。
  • 开发一种无需可 tractable 近似后验分布的方法,与 DVB 等变分方法不同。
  • 在无监督和监督表示学习任务中,证明其性能优于当前最先进的 MI 估计器。

提出的方法

  • MIGE 采用基于得分的估计方法,对隐式分布进行直接梯度估计,以估计互信息的梯度。
  • 使用带阈值的 RBF 核的谱 Stein 梯度估计器,以稳定梯度估计。
  • 该方法避免了对可 tractable 密度近似的依赖,从而可应用于一般分布。
  • 通过用梯度估计替代标准 MI 估计器,将 MIGE 集成到 InfoMax 和信息瓶颈目标函数中。
  • 通过判别器区分联合样本与边缘乘积样本,端到端训练该估计器。
  • 论文中的公式(8)通过带谱阈值机制的重参数化得分函数估计器,形式化了梯度估计。

实验结果

研究问题

  • RQ1与直接估计 MI 相比,直接估计 MI 梯度是否能带来更稳定、更准确的表示学习?
  • RQ2在现有估计器失效的高维和大 MI 设置下,MIGE 的表现如何?
  • RQ3MIGE 是否能在不依赖可 tractable 变分近似的情况下,同时提升 InfoMax 和信息瓶颈框架的性能?
  • RQ4RP 维度对 MIGE 中近似质量与计算成本的影响如何?
  • RQ5在误分类率和训练稳定性方面,MIGE 与 MINE 和 DVB 相比表现如何?

主要发现

  • MIGE-IB 在排列不变 MNIST 上实现 1.05% 的误分类率,优于 DVB(1.13%)和 MINE-IB(1.11%)。
  • 在 STL-10 上,分类准确率随表示维度增加至 128 时持续提升,之后因近似限制而趋于饱和。
  • 与现有方法相比,MIGE 在高维和大 MI 场景下提供了更紧密、更平滑的 MI 梯度估计。
  • 该方法表现出稳定的训练过程,避免了如 MINE 和 JSD 等未归一化判别器估计器常见的高方差问题。
  • 消融研究显示,将随机投影维度提升至 128 以上后,收益递减且计算成本增加。
  • 通过为 MI 优化提供可靠的梯度信号,MIGE 在无监督和监督表示学习中均实现了最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。