[论文解读] Hybrid VAE: Improving Deep Generative Models using Partial Observations
该论文提出混合变分自编码器(H-VAE),一种深度生成模型,通过联合学习标注数据与未完全标注的观测数据,提升样本质量和似然度。通过将变分推断与判别式后验近似相结合,H-VAE 利用未标注数据作为数据驱动正则化,仅需极少标注样本即可实现与完全监督模型相当的性能。
Deep neural network models trained on large labeled datasets are the state-of-the-art in a large variety of computer vision tasks. In many applications, however, labeled data is expensive to obtain or requires a time consuming manual annotation process. In contrast, unlabeled data is often abundant and available in large quantities. We present a principled framework to capitalize on unlabeled data by training deep generative models on both labeled and unlabeled data. We show that such a combination is beneficial because the unlabeled data acts as a data-driven form of regularization, allowing generative models trained on few labeled samples to reach the performance of fully-supervised generative models trained on much larger datasets. We call our method Hybrid VAE (H-VAE) as it contains both the generative and the discriminative parts. We validate H-VAE on three large-scale datasets of different modalities: two face datasets: (MultiPIE, CelebA) and a hand pose dataset (NYU Hand Pose). Our qualitative visualizations further support improvements achieved by using partial observations.
研究动机与目标
- 解决深度生成建模中因获取完整标注成本高、耗时长而导致的标注数据有限的问题。
- 开发一种可扩展的框架,利用大量未标注数据提升生成模型性能,而无需完全监督。
- 将判别式组件整合到变分自编码器中,实现对部分观测数据与完整标注数据的联合学习。
- 证明未标注数据可作为有效正则化手段,在低数据场景下提升似然度与样本质量。
提出的方法
- 使用深度 VAE 构建联合分布 $ p_{\theta}(\mathbf{d}, \mathbf{h}) $,并在共享潜在变量 $ \mathbf{z} $ 上引入无限潜在混合模型,其中 $ \mathbf{d} $ 为观测数据(如图像),$ \mathbf{h} $ 为连续标签(如面部关键点)。
- 推导边际似然 $ p_{\theta}(\mathbf{d}) = \int p_{\theta}(\mathbf{d}, \mathbf{h}) \, d\mathbf{h} $ 的变分下界,使模型可在标注数据 $ (\mathbf{d}, \mathbf{h}) $ 和未标注数据 $ \mathbf{d} $ 上进行训练。
- 引入辅助判别网络 $ q(\mathbf{h}|\mathbf{d}) $ 作为变分近似的一部分,提升推理能力与模型容量。
- 通过反向传播优化联合目标:标注数据上的完整似然与未标注数据上的边际似然之和。
- 使用重参数化技巧,实现对深度神经网络参数 $ \theta $ 与推理网络参数的端到端训练。
- 将模型应用于多模态数据,包括图像与连续标签,通过摊销变分推断实现可扩展的推理。
实验结果
研究问题
- RQ1当标注数据稀缺时,能否有效利用未标注数据提升深度生成模型的性能?
- RQ2如何构建一种混合生成-判别模型,以联合学习部分观测数据与完整标注?
- RQ3将未标注数据作为数据驱动正则化是否能提升深度生成模型的样本质量与对数似然度?
- RQ4能否将原理严谨的变分推断框架扩展至使用混合监督联合建模图像与连续标签?
主要发现
- H-VAE 在仅使用极少标注样本训练时,测试集对数似然度与完全监督 VAE 相当,证明未标注数据作为正则化手段的有效性。
- 定性结果表明,H-VAE 生成的图像及其对应标签(如面部关键点)比仅在标注数据上训练的标准 VAE 更具连贯性与真实性。
- 在三个大规模数据集(MultiPIE、CelebA 和 NYU Hand Pose)上,H-VAE 持续提升生成质量,似然度与视觉保真度均显著提高。
- 引入未标注数据可提升泛化能力,使模型学习到更鲁棒、更解耦的底层数据流形表征。
- 即使训练数据中仅有极小比例为完全标注,H-VAE 在生成性能上仍优于标准 VAE 与其他半监督基线模型。
- 判别组件 $ q(\mathbf{h}|\mathbf{d}) $ 提升了推理准确度并稳定了训练过程,尤其在低数据场景下表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。