Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Importance Weighted Autoencoders

Chin-Wei Huang, Kris Sankaran|arXiv (Cornell University)|May 13, 2019
Statistical Methods and Inference被引用 6
一句话总结

本文提出分层重要性加权自编码器(H-IWAE),一种变分推断方法,通过共享的元潜在变量诱导多个提议样本之间的负相关性,从而降低重要性加权下界估计的方差。该方法通过协调各提议以纠正个体错误,改善后验近似与推断性能,尤其在样本数量较大时效果更显著。

ABSTRACT

Importance weighted variational inference (Burda et al., 2015) uses multiple i.i.d. samples to have a tighter variational lower bound. We believe a joint proposal has the potential of reducing the number of redundant samples, and introduce a hierarchical structure to induce correlation. The hope is that the proposals would coordinate to make up for the error made by one another to reduce the variance of the importance estimator. Theoretically, we analyze the condition under which convergence of the estimator variance can be connected to convergence of the lower bound. Empirically, we confirm that maximization of the lower bound does implicitly minimize variance. Further analysis shows that this is a result of negative correlation induced by the proposed hierarchical meta sampling scheme, and performance of inference also improves when the number of samples increases.

研究动机与目标

  • 通过在样本间引入结构化依赖关系,解决重要性加权变分推断中的高方差问题。
  • 通过使用分层元采样器协调多个提议,提升后验近似质量。
  • 在理论上建立下界收敛性与估计量方差收敛性之间的联系。
  • 通过实证验证,最大化下界可隐式最小化因诱导负相关性而产生的方差。
  • 在标准密度估计基准上,通过采用优化加权启发式策略的分层采样,展示改进的推断性能。

提出的方法

  • 引入分层潜在结构,其中共享的元潜在变量 $\mathbf{z}_0$ 控制多个提议分布 $q_j(\mathbf{z}_j|\mathbf{z}_0)$,从而在样本间引入依赖性。
  • 推导出分层重要性加权下界(H-IWLB),通过引入共享元采样,推广标准IWAE下界。
  • 使用加权函数 $\pi_j$ 进行重要性加权以校正偏差,采用如均匀平均($\alpha=0$)和平衡加权($\alpha=1$)等启发式方法。
  • 通过梯度优化训练模型,采用神经网络编码器实现近端推断。
  • 应用重要性重采样(SIR)以可视化和分析所学习提议的相关性结构。
  • 使用Polyak平均和学习率调度策略,提升在标准密度估计数据集上的训练稳定性。

实验结果

研究问题

  • RQ1分层元采样方案是否能降低变分推断中重要性加权估计量的方差?
  • RQ2在多个提议中引入负相关性是否能提升变分下界的紧致性?
  • RQ3加权启发式的选择如何影响所学习提议的形状与相关性结构?
  • RQ4最大化H-IWLB是否能隐式最小化下界蒙特卡洛估计量的方差?
  • RQ5与标准IWAE相比,分层采样是否能在标准密度估计基准上提升推断性能?

主要发现

  • H-IWAE模型通过共享元潜在变量 $\mathbf{z}_0$ 在提议间诱导负相关性,显著降低了重要性加权估计量的方差。
  • 实证结果证实,最大化H-IWLB可隐式降低估计量方差,支持了下界收敛性与方差收敛性之间的理论关联。
  • 当 $\alpha=1$(平衡启发式)时,提议更加专业化且呈现负相关性,随着 $K$ 增大,在二值化MNIST和OMNIGLOT数据集上性能更优。
  • 在Caltech101草图数据集上,H-IWAE在 $K=5$ 且 $\alpha=1$ 时优于标准高斯IWAE和单层次提议的IWAE,尽管性能仍低于最佳基线。
  • 在每个小批量中重复更新编码器参数后再更新解码器,显著提升了H-IWAE性能,表明由于更优的推断模型优化,其近端偏差有所降低。
  • 可视化结果表明,使用共同 $\mathbf{z}_0$ 训练的提议呈现负相关性,而独立 $\mathbf{z}_0$ 则导致正相关偏差,性能更差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。