Skip to main content
QUICK REVIEW

[论文解读] S3VAE: Self-Supervised Sequential VAE for Representation Disentanglement and Data Generation

Yizhe Zhu, Martin Renqiang Min|arXiv (Cornell University)|May 23, 2020
Generative Adversarial Networks and Image Synthesis参考文献 56被引用 8
一句话总结

该论文提出S3VAE,一种自监督的序列变分自编码器,通过光学流和音频音量等内在监督信号,将序列数据表征解耦为时不变(静态)和时变(动态)因子。该模型在解耦性能上与全监督方法相当,并在视频和音频生成任务上超越了当前最先进(SOTA)的无监督模型。

ABSTRACT

We propose a sequential variational autoencoder to learn disentangled representations of sequential data (e.g., videos and audios) under self-supervision. Specifically, we exploit the benefits of some readily accessible supervisory signals from input data itself or some off-the-shelf functional models and accordingly design auxiliary tasks for our model to utilize these signals. With the supervision of the signals, our model can easily disentangle the representation of an input sequence into static factors and dynamic factors (i.e., time-invariant and time-varying parts). Comprehensive experiments across videos and audios verify the effectiveness of our model on representation disentanglement and generation of sequential data, and demonstrate that, our model with self-supervision performs comparable to, if not better than, the fully-supervised model with ground truth labels, and outperforms state-of-the-art unsupervised models by a large margin.

研究动机与目标

  • 解决视频和音频等序列数据中表征解耦的挑战,其中身份与运动、音色与语言内容等因子需被分离。
  • 克服无监督方法的局限性,后者常因缺乏归纳偏置且依赖随机初始化,导致在真实数据上泛化能力不足。
  • 通过利用数据本身或现成模型(如光学流、音频能量)提供的现成监督信号,减少对昂贵人工标注的依赖。
  • 通过引入基于自监督的辅助任务和正则化,提升序列VAE中解耦与生成质量。
  • 证明自监督可实现与全监督方法相当或更优的序列数据表征解耦性能。

提出的方法

  • 提出一种循环变分自编码器架构,将潜在空间分解为静态因子 $\bm{z}_f$(时不变)和动态因子 $\bm{z}_t$(时变)。
  • 引入静态一致性约束 ($\mathcal{L}_{SSC}$),强制 $\bm{z}_f$ 在输入序列时间顺序打乱后保持不变。
  • 设计动态因子预测头 ($\mathcal{L}_{DFP}$),用于从视频数据的光学流或音频片段的音量中预测运动位置。
  • 应用互信息最小化 ($\mathcal{L}_{MI}$) 以减少 $\bm{z}_f$ 与 $\bm{z}_t$ 之间的信息泄漏,从而促进解耦。
  • 端到端训练模型,结合重建损失、辅助监督和正则化,联合优化解耦与生成性能。
  • 利用现成模型(如光学流估计器)提取监督信号,无需额外训练或标注。

实验结果

研究问题

  • RQ1与无监督方法相比,来自内在数据信号(如光学流、音频能量)的自监督是否能有效提升序列表征的解耦性能?
  • RQ2自监督辅助任务在多大程度上可达到或超越依赖昂贵人工标注的全监督模型的性能?
  • RQ3各个组件(如静态一致性、动态预测、互信息正则化)在潜在空间解耦中分别起到何种作用?
  • RQ4该模型能否在不同模态(如视频和音频)间泛化,同时保持强解耦性和生成质量?
  • RQ5最小化静态与动态因子之间的互信息是否能实现潜在空间中语义因子的更清晰分离?

主要发现

  • 在MUG数据集上,S3VAE在使用完整监督组件时达到70.51%的解耦准确率,显著优于消融变体和基线模型。
  • 消融研究显示,若移除互信息正则化 ($\mathcal{L}_{MI}$),准确率降至66.07%,表明其在抑制动态码中外观信息方面的关键作用。
  • 静态一致性损失 ($\mathcal{L}_{SSC}$) 至关重要——其移除使准确率降至61.45%,证实时间顺序打乱有助于分离静态因子。
  • 动态因子预测损失 ($\mathcal{L}_{DFP}$) 对运动建模至关重要;其移除使准确率降至58.32%,表明缺乏该损失时运动信息编码效果差。
  • 在TIMIT数据集上,S3VAE使用 $\bm{z}_f$ 进行说话人验证的等错误率(EER)为4.80%,优于FHVAE和DSVAE,并将 $\bm{z}_{1:T}$ 的EER降低至40.12%,表明音色信息被有效从动态码中去除。
  • 定性结果表明,若无 $\mathcal{L}_{MI}$,胡须等面部特征仍残留在动态码中;若无 $\mathcal{L}_{SSC}$,静态与动态因子仍存在纠缠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。