[论文解读] Bidirectional Helmholtz Machines
该论文提出双向赫姆霍兹机(BiHMs),一种深度生成模型,通过将自顶向下和自底向上近似推理模型的几何平均构建联合分布。通过优化一个最小化这些模型之间巴氏距离的下界,BiHMs 实现了最先进的似然度,且推理效率显著更高,支持更深的网络结构,并在似然估计速度上比 VAE、RWS 或 IWAE 快几个数量级。
Efficient unsupervised training and inference in deep generative models remains a challenging problem. One basic approach, called Helmholtz machine, involves training a top-down directed generative model together with a bottom-up auxiliary model used for approximate inference. Recent results indicate that better generative models can be obtained with better approximate inference procedures. Instead of improving the inference procedure, we here propose a new model which guarantees that the top-down and bottom-up distributions can efficiently invert each other. We achieve this by interpreting both the top-down and the bottom-up directed models as approximate inference distributions and by defining the model distribution to be the geometric mean of these two. We present a lower-bound for the likelihood of this model and we show that optimizing this bound regularizes the model so that the Bhattacharyya distance between the bottom-up and top-down approximate distributions is minimized. This approach results in state of the art generative models which prefer significantly deeper architectures while it allows for orders of magnitude more efficient approximate inference.
研究动机与目标
- 解决在复杂、多模态数据分布下深度生成模型的高效训练与推理挑战。
- 克服现有方法(如 VAE 和 RWS)的局限性,这些方法因后验近似不准确而导致计算成本高且似然估计性能差。
- 开发一种模型,其自顶向下与自底向上推理分布自然地被正则化为彼此接近,从而提升生成性能并支持更深的网络结构。
- 通过确保模型的真实后验被两种推理网络良好近似,实现更高效的似然估计。
提出的方法
- 将真实联合分布 $p^*({\bf x}, {\bf h}_1, {\bf h}_2)$ 定义为两个有向模型的归一化几何平均:$p({\bf x}, {\bf h}_1, {\bf h}_2)$(自顶向下)和 $q({\bf x}, {\bf h}_1, {\bf h}_2)$(自底向上)。
- 使用一个变分下界来近似对数似然,其中包含一个正则化项,以最小化自顶向下与自底向上近似后验之间的巴氏距离。
- 使用随机梯度下降配合重要性采样,高效估计对数似然。
- 利用几何平均模型的对称性,实现高效的分布式训练,仅需在层间传输二值激活和重要性权重。
- 通过从完整的无向 BiHM 模型 $p^*$ 中进行采样来执行推理,该模型得益于 $p$ 与 $q$ 之间的高度相似性。
- 采用两层架构,包含随机隐藏单元,其中 $p$ 从 ${\bf h}_2$ 生成 ${\bf x}$,$q$ 从 ${\bf x}$ 推断 ${\bf h}_2$,两者均由神经网络参数化。
实验结果
研究问题
- RQ1是否可以构建一种生成模型,使其真实后验被自顶向下和自底向上推理网络良好近似?
- RQ2最小化自顶向下与自底向上推理分布之间的巴氏距离是否能带来更好的似然估计和模型质量?
- RQ3该方法是否能有效训练更深的网络结构,特别是在标准 VAE 因后验近似不佳而表现困难的情况下?
- RQ4与 RWS、VAE 或 IWAE 相比,该框架中的似然估计是否显著更高效?
- RQ5该模型的对称结构是否能支持半监督或动态观测设置下的灵活推理?
主要发现
- 在 MNIST 数据集上,BiHM 模型的测试集对数似然达到 $-86.3 \times 10^{-3} \times 10^3$(即 $-86.3$),优于 RWS 和 VAE 基线模型。
- BiHM 的估计有效样本量(ESS)为 $1.2\% \pm 0.2\%$,表明近似后验被推理网络良好建模。
- 当使用 $K=10$ 个重要性样本时,BiHM 的对数似然估计值高于 RWS 使用 $K=10,000$ 个样本的结果,证明了其更高的样本效率。
- BiHM 模型仅需 $K=10$ 到 $100$ 个样本即可实现具有竞争力的似然估计,而 VAE、RWS 和 IWAE 需要约 $10,000$ 个样本才能达到相当的性能。
- BiHM 训练在每次更新步骤中收敛更快,总训练时间具有竞争力,且由于通信开销低,具备高效分布式实现的潜力。
- 训练完成后,BiHM 中的自顶向下模型 $p$ 在对数似然和样本质量方面均优于 RWS,而从完整 $p^*$ 模型中采样可进一步提升样本保真度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。