Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Video Domain Adaptation for Action Recognition: A Disentanglement Perspective

Pengfei Wei, Lingdong Kong|arXiv (Cornell University)|Aug 15, 2022
Anomaly Detection Techniques and Applications被引用 9
一句话总结

本文提出TranSVAE,一种新颖的无监督视频域自适应框架,将视频表征解耦为特定于域的静态因子和域不变的动态因子。通过分别建模视频生成的潜在因子并施加解耦约束,该方法有效减少了空间和时间域偏移,在UCF-HMDB、Jester和Epic-Kitchens基准上实现了最先进性能。

ABSTRACT

Unsupervised video domain adaptation is a practical yet challenging task. In this work, for the first time, we tackle it from a disentanglement view. Our key idea is to handle the spatial and temporal domain divergence separately through disentanglement. Specifically, we consider the generation of cross-domain videos from two sets of latent factors, one encoding the static information and another encoding the dynamic information. A Transfer Sequential VAE (TranSVAE) framework is then developed to model such generation. To better serve for adaptation, we propose several objectives to constrain the latent factors. With these constraints, the spatial divergence can be readily removed by disentangling the static domain-specific information out, and the temporal divergence is further reduced from both frame- and video-levels through adversarial learning. Extensive experiments on the UCF-HMDB, Jester, and Epic-Kitchens datasets verify the effectiveness and superiority of TranSVAE compared with several state-of-the-art approaches. Code is publicly available.

研究动机与目标

  • 为解决无监督视频域自适应中的挑战,即空间和时间域偏移阻碍模型泛化的问题。
  • 克服现有端到端方法的局限性,这些方法虽联合处理空间和时间域差距,但缺乏显式的解耦。
  • 通过生成建模显式解耦特定于域的静态内容与与动作相关的动态运动,实现有效的域自适应。
  • 通过在帧级和视频级对动态因子进行对抗对齐,减少时间域偏移;通过解耦特定于域的静态因子,减少空间域偏移。
  • 仅使用源域有标签数据和目标域无标签数据,通过解耦的、域不变的表征提升下游动作识别性能。

提出的方法

  • 提出一种迁移序列变分自编码器(TranSVAE),通过两个解耦的潜在因子生成视频:特定于域的静态因子和与动作相关的动态因子。
  • 使用互信息最小化来强制静态与动态潜在因子之间的独立性,确保有效解耦。
  • 在静态因子上应用对比三元组损失,使其具有域特定性且对动作内容不变,从而实现空间域偏移的轻松消除。
  • 在帧级和视频级实施对抗学习,对齐不同域之间的动态因子,减少时间域偏移。
  • 在源数据的动态因子上集成任务特定监督,以保留动作识别的语义信息。
  • 采用两阶段训练流程:首先使用重建和解耦目标预训练自编码器,然后使用对抗损失和分类损失进行微调。

实验结果

研究问题

  • RQ1在视频表征中解耦静态(特定于域)和动态(与动作相关)因子,是否能提升无监督域自适应中的动作识别性能?
  • RQ2通过解耦显式分离空间和时间域偏移,是否比联合对齐方法带来更好的泛化性能?
  • RQ3在保留动态因子中动作语义的前提下,静态因子在多大程度上可被移除以消除空间域偏移?
  • RQ4在帧级和视频级对动态因子进行对抗对齐,在减少时间域偏移方面有多高效?
  • RQ5解耦的动态因子是否可用于跨域迁移动作,同时保留外观特征,从而实现类似风格迁移的能力?

主要发现

  • TranSVAE在UCF-HMDB数据集上达到最先进性能,显著优于先前方法,在H→U设置中取得5.2%的绝对性能提升。
  • 在Jester数据集上,TranSVAE相比第二好的方法提升4.1%,表明其在多样化视频域中具有强大泛化能力。
  • 在Epic-Kitchens数据集上,TranSVAE相比之前最先进方法提升3.8%准确率,证实其在长尾、真实世界视频设置下的有效性。
  • 消融实验表明,若移除静态因子上的对比损失或动态因子上的对抗对齐,性能均显著下降,验证了二者必要性。
  • 定性结果表明,静态因子捕捉了特定于域的外观特征(如角色风格),而动态因子编码了动作语义;跨域因子交换可实现保留外观的动作迁移。
  • 模型对伪标签阈值具有鲁棒性,最优性能在特定任务阈值下实现(U→H为η=0.93,H→U为η=0.96),表明在超参数变化下仍具稳定适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。