[论文解读] A Review of Learning with Deep Generative Models from Perspective of Graphical Modeling
本文通过图模型的视角回顾了深度生成模型(DGMs),区分了有向模型与无向模型,并将模型定义与学习算法分离。文章系统比较了关键学习方法——如变分推断、基于得分的训练和对抗学习——突出其理论基础、实际挑战及相互联系,特别关注VAE、GAN和噪声对比估计等近期进展。
This document aims to provide a review on learning with deep generative models (DGMs), which is an highly-active area in machine learning and more generally, artificial intelligence. This review is not meant to be a tutorial, but when necessary, we provide self-contained derivations for completeness. This review has two features. First, though there are different perspectives to classify DGMs, we choose to organize this review from the perspective of graphical modeling, because the learning methods for directed DGMs and undirected DGMs are fundamentally different. Second, we differentiate model definitions from model learning algorithms, since different learning algorithms can be applied to solve the learning problem on the same model, and an algorithm can be applied to learn different models. We thus separate model definition and model learning, with more emphasis on reviewing, differentiating and connecting different learning algorithms. We also discuss promising future research directions.
研究动机与目标
- 通过图模型框架对深度生成模型(DGMs)进行系统性组织,强调有向模型与无向模型在学习方法上的根本差异。
- 将模型定义与学习算法解耦,以更清晰地理解不同算法如何应用于同一模型,反之亦然。
- 比较并连接DGM中主要的学习范式,包括变分推断、基于得分的训练、对抗学习和噪声对比估计(NCE),突出其理论与实际差异。
- 识别DGM学习中的开放挑战,如训练稳定性、离散潜在变量和序列建模问题,并提出未来研究方向。
- 提供一份全面且最新的DGM学习综述,通过聚焦算法的差异性与统一性,而非模型的品牌化特征,补充现有综述。
提出的方法
- 使用图模型术语将DGMs分类为有向模型(贝叶斯网络)与无向模型(马尔可夫随机场),由于无向模型中存在分区函数,导致其学习方法与有向模型有本质不同。
- 提出一种将模型定义(如VAE、GAN)与学习算法(如变分推断、对抗训练)分离的框架,支持跨模型分析。
- 通过证据下界(ELBO)回顾变分推断,将目标表述为通过近似后验 $ q_{\phi}(h|x) $ 最大化对数似然的下界。
- 将对抗学习建模为通过判别器 $ D_{\psi}(x) $ 最小化 $ f $-散度,其中对数几率 $ V_{\psi}(x) = \log \frac{D_{\psi}(x)}{1 - D_{\psi}(x)} $ 是训练目标的关键组成部分,并将其与噪声对比估计(NCE)联系起来。
- 应用“代入技巧”(plugging trick),通过用辅助优化问题的解替代不可计算项(如似然比),将难以处理的单目标优化问题转化为可处理的多目标问题。
- 推导出NCE与 $ f $-散度变分估计之间的联系,表明在特定 $ f $-函数和辅助分布下,NCE目标等价于一个变分下界。
实验结果
研究问题
- RQ1由于无向模型中存在分区函数,有向与无向深度生成模型的学习方法在根本上存在何种差异?
- RQ2在多大程度上可以将学习算法与模型定义解耦?这种解耦如何提升对VAE和GAN等DGM的理解?
- RQ3在深度生成模型中,使用随机隐藏层与确定性隐藏层之间的理论与实际权衡是什么?
- RQ4如何通过代入技巧将DGM学习中的不可计算优化问题转化为可计算的多目标问题?
- RQ5在 $ f $-散度最小化背景下,噪声对比估计(NCE)、变分推断与对抗学习之间存在何种联系?
主要发现
- 该综述确立了由于无向模型中存在分区函数,有向与无向DGMs需要根本不同的学习方法,这使得基于似然的训练更加复杂。
- 变分推断通过优化近似后验 $ q_{\phi}(h|x) $ 提供了对数似然的可计算下界(ELBO),从而实现了VAE等模型的端到端训练。
- 对抗学习,特别是通过GAN实现,通过判别器 $ D_{\psi}(x) $ 最小化 $ f $-散度,其中对数几率 $ V_{\psi}(x) $ 成为训练目标的关键组成部分。
- 噪声对比估计(NCE)通过使用已知噪声分布来估计模型密度,为基于似然的训练提供了一致且稳定的替代方案,其目标函数在特定条件下等价于变分下界。
- 代入技巧通过用辅助优化问题的解替代不可计算项,实现了将难以处理的单目标问题转化为可计算的多目标问题,但需验证梯度一致性。
- 本文识别出若干关键开放挑战:训练稳定性、处理离散潜在变量与观测变量、序列建模,这些问题仍是当前研究的活跃领域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。