Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Domain Adaptation for Video Transformers in Action Recognition

Victor G. Turrisi da Costa, Giacomo Zara|arXiv (Cornell University)|Jul 26, 2022
Human Pose and Action Recognition被引用 4
一句话总结

该论文提出了一种新颖的无监督域自适应框架 UDAVT,用于视频动作识别,其基于时空变换器主干网络,并引入了一种受信息瓶颈启发的域对齐损失。通过联合微调空间与时间变换器并结合域不变特征学习,UDAVT 在 HMDB→UCF 和更具挑战性的 Kinetics→NEC-Drone 域自适应基准上均取得了当前最优性能,展现出对显著域偏移的强大鲁棒性。

ABSTRACT

Over the last few years, Unsupervised Domain Adaptation (UDA) techniques have acquired remarkable importance and popularity in computer vision. However, when compared to the extensive literature available for images, the field of videos is still relatively unexplored. On the other hand, the performance of a model in action recognition is heavily affected by domain shift. In this paper, we propose a simple and novel UDA approach for video action recognition. Our approach leverages recent advances on spatio-temporal transformers to build a robust source model that better generalises to the target domain. Furthermore, our architecture learns domain invariant features thanks to the introduction of a novel alignment loss term derived from the Information Bottleneck principle. We report results on two video action recognition benchmarks for UDA, showing state-of-the-art performance on HMDB$\leftrightarrow$UCF, as well as on Kinetics$ ightarrow$NEC-Drone, which is more challenging. This demonstrates the effectiveness of our method in handling different levels of domain shift. The source code is available at https://github.com/vturrisi/UDAVT.

研究动机与目标

  • 为解决视频动作识别中的域偏移问题,即在某一领域(如 HMDB)上训练的模型在另一相关但不同的领域(如 UCF 或 NEC-Drone)上性能下降的问题。
  • 将此前在图像领域发展成熟的无监督域自适应(UDA)技术,拓展至具有时间动态特性的更复杂的视频领域。
  • 开发一种鲁棒的、端到端可训练的 UDA 框架,通过在视频变换器中学习域不变表示来提升泛化能力。
  • 在标准的视频动作识别 UDA 基准上评估所提方法的有效性,包括具有挑战性的跨数据集设置。

提出的方法

  • 该方法采用两阶段训练策略:首先仅在源数据上微调整个变换器;随后冻结空间变换器,仅对时间变换器进行进一步微调,并引入一种新型域对齐损失。
  • 核心创新在于一种基于信息瓶颈(IB)原理的新域对齐损失,该损失促使模型仅保留与动作类别相关的信息,同时丢弃与域相关的差异。
  • 该损失在训练的第二阶段应用,利用源模型在目标数据上生成的伪标签,对齐跨域的特征分布。
  • 模型架构基于 STAM(时空注意力模块)的共享编码器,结合用于空间特征提取的视觉变换器(ViT)和用于时间聚合的多层变换器。
  • 采用动量更新的目标特征队列,以稳定域对齐组件的训练,提升特征的一致性。
  • 在监督和无监督设置下均对方法进行了评估,并通过消融实验研究了队列和伪标签质量的作用。

实验结果

研究问题

  • RQ1能否仅使用源数据和无标签目标数据,有效将基于变换器的视频模型适配到新域,而无需目标标签?
  • RQ2与现有 UDA 损失相比,基于信息瓶颈的损失在对齐视频动作识别中的域不变特征方面是否更有效?
  • RQ3所提出的两阶段训练策略——先在源数据上预训练,再对时间流进行带域对齐的微调——是否能提升模型在域偏移下的泛化能力?
  • RQ4目标伪标签的质量如何影响域自适应过程的性能?
  • RQ5当重新用于视频动作识别的域自适应任务时,所提方法是否能超越重新利用的自监督对比学习方法(如 SimCLR、VICReg)?

主要发现

  • UDAVT 在 HMDB→UCF 基准上取得了当前最优性能,显著优于先前方法。
  • 在更具挑战性的 Kinetics→NEC-Drone 基准上,UDAVT 达到 65.3% 的准确率,相比第二好的方法性能提升超过 16%。
  • 消融实验表明,动量队列和高质量伪标签对最优性能至关重要,尤其在无监督设置下。
  • 该方法优于重新用于域自适应的自监督对比学习方法(如 SimCLR 和 VICReg),后者虽经调整但仍表现逊色于所提出的基于 IB 的损失。
  • 可视化注意力图显示,UDAVT 改进了时空定位能力,使模型能更准确地聚焦于序列中与动作相关的关键帧。
  • 结果表明,基于 IB 的损失能有效通过学习解耦表示来减少域偏移,保留类别信息的同时剔除与域相关的噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。