[论文解读] Disentangled VAE Representations for Multi-Aspect and Missing Data
本文提出 factVAE,一种深度生成模型,通过在多方面数据(如视图、模态)上对变分自编码器进行因子分解,实现在缺失数据情况下的鲁棒生成与重建。通过使用专家乘积进行后验聚合,并采用组稀疏先验以强制实现解耦,factVAE 在动作捕捉和多姿态人脸数据集上实现了最先进水平的重建性能——即使在观测有限或不完整的情况下——同时生成可解释的、解耦的潜在表征。
Many problems in machine learning and related application areas are fundamentally variants of conditional modeling and sampling across multi-aspect data, either multi-view, multi-modal, or simply multi-group. For example, sampling from the distribution of English sentences conditioned on a given French sentence or sampling audio waveforms conditioned on a given piece of text. Central to many of these problems is the issue of missing data: we can observe many English, French, or German sentences individually but only occasionally do we have data for a sentence pair. Motivated by these applications and inspired by recent progress in variational autoencoders for grouped data, we develop factVAE, a deep generative model capable of handling multi-aspect data, robust to missing observations, and with a prior that encourages disentanglement between the groups and the latent dimensions. The effectiveness of factVAE is demonstrated on a variety of rich real-world datasets, including motion capture poses and pictures of faces captured from varying poses and perspectives.
研究动机与目标
- 为解决在存在缺失观测的多方面数据上训练深度生成模型的挑战,传统 VAE 因要求完全观测输入而失效。
- 开发一个统一框架,联合建模多个数据方面(如视图、模态、传感器组),同时保持可解释性和鲁棒性。
- 通过将不同方面与潜在维度的稀疏、非重叠子集关联,实现潜在表示的解耦表征学习,重叠支持用于捕捉跨方面的相关性。
- 通过利用共享稀疏性和一致的方面特定编码器聚合,提升低数据场景下的重建性能。
- 提供一种系统性方法,用于处理结构化多方面数据中任意缺失模式的问题,无需预先插补。
提出的方法
- 将 VAE 编码器和解码器分解为面向方面的映射,使每个方面可独立处理,随后一致地组合。
- 采用专家乘积(PoE)框架组合方面特定的变分后验,确保后验熵随更多观测方面的增加而降低。
- 在编码器和解码器权重上施加组稀疏先验,以强制实现稀疏性,将每个方面与潜在维度的特定子集关联。
- 在编码器和解码器组件之间施加共享稀疏性,以确保潜在空间支持的一致性,提升泛化能力。
- 使用深度神经网络实现推理(编码器)和生成(解码器),并通过随机梯度变分推断优化参数。
- 采用重参数化技巧,实现即使在训练和推理过程中存在缺失数据时,也能端到端训练完整模型。
实验结果
研究问题
- RQ1当在训练或推理过程中某些方面缺失时,深度生成模型能否有效重建多方面数据?
- RQ2在多方面 VAE 中,如何强制实现方面与潜在维度之间的解耦,以提升可解释性和泛化能力?
- RQ3在缺失数据设置下,使用专家乘积方法组合方面特定编码器是否能获得比标准 VAE 更优的后验近似和重建性能?
- RQ4编码器和解码器权重中的共享稀疏性是否能带来更可解释且更鲁棒的多方面数据表征?
- RQ5与 JMVAE 或标准 VAE 等现有方法相比,factVAE 在低数据场景下的表现如何?
主要发现
- 在动作捕捉数据集上,factVAE 在测试对数似然上达到最先进水平,当在 10 个序列上训练时,对保留行走序列的得分达到 89,优于基线 JMVAE 和非稀疏 factVAE 变体。
- 在 CVL 人脸数据库上,factVAE 能够成功重建未见受试者的缺失姿态(如露齿微笑),即使仅基于单一视角也生成了逼真的样本。
- 该模型在动作捕捉和人脸数据集上均展现出卓越的重建质量,定性结果表明其能准确恢复复杂姿态和面部特征。
- 学习到的稀疏模式揭示了可解释的关系:例如,四肢和躯干分别与不同的潜在维度关联,而脊柱和头部组则与多个组件重叠。
- 在合成条形实验中,factVAE 正确恢复了真实的潜在稀疏结构,证实其学习有意义解耦表征的能力。
- 引入组稀疏先验(λ=1)相比非稀疏基线(λ=0)显著提升了性能,在 10 次试验设置下,对数似然得分从 555 提升至 600,表明稀疏性对鲁棒性至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。