Skip to main content
QUICK REVIEW

[论文解读] Contrastively Disentangled Sequential Variational Autoencoder

Junwen Bai, Weiran Wang|arXiv (Cornell University)|Oct 22, 2021
Generative Adversarial Networks and Image Synthesis参考文献 58被引用 14
一句话总结

该论文提出了一种对比解耦序列变分自编码器(C-DSVAE),一种新颖的自监督解耦表征学习方法,通过在潜在空间中显式分离静态(时不变)和动态(时变)因子,实现对序列数据的解耦表征学习。该方法利用互信息的对比估计来促进解耦,同时借助数据增强注入归纳偏置,在视频和音频基准测试中达到最先进性能。

ABSTRACT

Self-supervised disentangled representation learning is a critical task in sequence modeling. The learnt representations contribute to better model interpretability as well as the data generation, and improve the sample efficiency for downstream tasks. We propose a novel sequence representation learning method, named Contrastively Disentangled Sequential Variational Autoencoder (C-DSVAE), to extract and separate the static (time-invariant) and dynamic (time-variant) factors in the latent space. Different from previous sequential variational autoencoder methods, we use a novel evidence lower bound which maximizes the mutual information between the input and the latent factors, while penalizes the mutual information between the static and dynamic factors. We leverage contrastive estimations of the mutual information terms in training, together with simple yet effective augmentation techniques, to introduce additional inductive biases. Our experiments show that C-DSVAE significantly outperforms the previous state-of-the-art methods on multiple metrics.

研究动机与目标

  • 学习序列数据中的解耦表征,分离静态(时不变)与动态(时变)因子,以提升可解释性与样本效率。
  • 解决在缺乏强归纳偏置的情况下学习有意义解耦表征的挑战,特别是在高维序列数据中。
  • 通过引入对比学习与数据增强,提升互信息估计质量,从而改善表征质量。
  • 构建一个系统性框架,协同结合对比估计与序列变分自编码器,实现解耦表征学习。

提出的方法

  • C-DSVAE 使用因子化潜在空间建模输入序列的联合似然,其中包含静态因子 $ s $ 和动态因子 $ z_{1:T} $,并假设 $ p(s, z_{1:T}) = p(s)p(z_{1:T}) $。
  • 提出一种新型证据下界(ELBO),通过最大化输入 $ x_{1:T} $ 与潜在因子 $ s, z_{1:T} $ 之间的互信息,同时最小化 $ s $ 与 $ z_{1:T} $ 之间的互信息。
  • 采用对比估计近似互信息项,利用增强视图:运动增强的 $ x_{1:T}^m $ 和内容增强的 $ x_{1:T}^c $,以构建正样本对。
  • 通过数据增强生成对比学习的正样本:$ z_{1:T}^m $ 作为 $ z_{1:T} $ 关于运动的正样本,$ s^c $ 作为 $ s $ 关于内容的正样本。
  • 训练目标包含对 $ I(s; x_{1:T}) $ 和 $ I(z_{1:T}; x_{1:T}) $ 的对比估计,而 $ I(s; z_{1:T}) $ 则通过小批量加权采样(MWS)估计。
  • 网络架构采用LSTM进行序列编码,并结合 $ s $ 与 $ z_i $ 解码帧,实现解耦生成。

实验结果

研究问题

  • RQ1对比互信息估计是否能提升序列变分自编码器中的解耦性能?
  • RQ2对比学习与数据增强的结合在学习序列数据不变表征方面有多有效?
  • RQ3分离静态与动态因子是否能带来优于标准VAE的解耦性能与下游任务表现?
  • RQ4对比估计在解耦表征学习中相比标准MWS-based MI估计的优越程度如何?
  • RQ5该模型能否在独立保持内容与运动的前提下,维持潜在空间中平滑且有意义的插值?

主要发现

  • 在MUG数据集上,C-DSVAE取得81.16%的准确率,显著优于DSVAE(54.29%)和使用全部MWS估计的DSVAE(66.25%)。
  • 在SM-MNIST上,C-DSVAE达到97.84%的准确率,超越DSVAE(88.19%)和使用全部MWS的DSVAE(91.81%)。
  • 在TIMIT数据集上,C-DSVAE提升了Fréchet Audio Distance(FAD)与Inception Score(IS),内容EER为4.03%,运动EER为31.81%(批量大小为256)。
  • 对比互信息估计导致 $ I(s; x_{1:T}) $ 随MWS测量值单调上升,表明表征学习有效。
  • 潜在空间插值显示内容平滑过渡而运动保持不变,证明了潜在空间中解耦性与连续性。
  • 消融实验表明,对比估计对性能的贡献大于基于MWS的MI估计,凸显其在注入有用归纳偏置中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。