Skip to main content
QUICK REVIEW

[论文解读] Multi-Source Video Domain Adaptation with Temporal Attentive Moment Alignment

Yuecong Xu, Jianfei Yang|arXiv (Cornell University)|Sep 21, 2021
Domain Adaptation and Few-Shot Learning参考文献 45被引用 5
一句话总结

本文提出TAMAN,一种用于多源视频域自适应(MSVDA)的新颖时间注意力时刻对齐网络,通过联合对齐多个源域与目标域之间的空间与时间特征时刻,实现跨域特征对齐。通过关注高置信度、域不变的局部时间特征并动态对齐时刻,TAMAN有效减少了负迁移现象,并在新构建的综合性MSVDA基准上实现了最先进性能。

ABSTRACT

Multi-Source Domain Adaptation (MSDA) is a more practical domain adaptation scenario in real-world scenarios. It relaxes the assumption in conventional Unsupervised Domain Adaptation (UDA) that source data are sampled from a single domain and match a uniform data distribution. MSDA is more difficult due to the existence of different domain shifts between distinct domain pairs. When considering videos, the negative transfer would be provoked by spatial-temporal features and can be formulated into a more challenging Multi-Source Video Domain Adaptation (MSVDA) problem. In this paper, we address the MSVDA problem by proposing a novel Temporal Attentive Moment Alignment Network (TAMAN) which aims for effective feature transfer by dynamically aligning both spatial and temporal feature moments. TAMAN further constructs robust global temporal features by attending to dominant domain-invariant local temporal features with high local classification confidence and low disparity between global and local feature discrepancies. To facilitate future research on the MSVDA problem, we introduce comprehensive benchmarks, covering extensive MSVDA scenarios. Empirical results demonstrate a superior performance of the proposed TAMAN across multiple MSVDA benchmarks.

研究动机与目标

  • 为解决多源视频域自适应(MSVDA)中的负迁移挑战,即多个源域在空间-时间分布上存在显著差异。
  • 构建一个统一框架,联合对齐所有源-目标域对之间的空间与时间特征时刻。
  • 通过关注具有高分类置信度且全局与局部表征差异小的局部时间特征,构建鲁棒的全局时间特征。
  • 利用真实世界视频数据集(涵盖多样化域偏移)构建全面、大规模的基准,以支持未来MSVDA研究。
  • 在包含多个源域和具有挑战性的目标域的多样化、真实MSVDA场景中,验证所提方法的有效性。

提出的方法

  • TAMAN采用ResNet-101主干网络并结合时间关系网络进行帧级特征提取,冻结预训练层并微调新增层。
  • 通过注意力机制对局部时间特征加权聚合,生成全局时间特征,权重由局部分类置信度及全局与局部特征分布间的差异决定。
  • 在所有域对之间执行基于时刻的空间与时间特征对齐,最小化分布差异的同时降低负迁移。
  • 采用带有可学习权重(λdf=0.005,λdt=0.01)的双重差异损失,以平衡空间与时间特征对齐。
  • 网络在100个周期(Daily-DA)或40个周期(Sports-DA)内使用SGD进行训练,学习率采用余弦衰减策略并加入权重衰减。
  • 通过在源域上联合优化特征对齐损失与分类损失,实现域不变表示学习。

实验结果

研究问题

  • RQ1如何有效减少因多个源域间空间-时间分布不一致所导致的多源视频域自适应(MSVDA)中的负迁移?
  • RQ2对局部时间特征施加注意力机制是否能提升MSVDA中全局时间表征的鲁棒性与不变性?
  • RQ3在所有域对之间联合对齐空间与时间特征时刻,是否能比成对对齐带来更好的泛化性能?
  • RQ4不同源域组合(如Kinetics、UCF101、HMDB51)在真实世界视频自适应场景中如何影响模型性能?
  • RQ5统一框架是否能在具有显著域偏移的大规模、多样化视频基准上超越现有UDA与VUDA方法?

主要发现

  • TAMAN在多个MSVDA基准(包括Daily-DA与Sports-DA)上均达到最先进性能,展现出在复杂域偏移下的卓越泛化能力。
  • 所提出的对局部时间特征的注意力机制显著提升了全局特征的鲁棒性,尤其在如ARID(低光照域)等RGB统计差异显著的域中表现突出。
  • 空间与时间特征时刻的联合对齐有效减少了错位与负迁移,优于独立或成对对齐特征的方法。
  • 在Daily-DA基准上,TAMAN在全部四个目标域(A、H、M、K)中均实现一致的准确率提升,尤其在最具挑战性的ARID域中提升显著。
  • 在更大的Sports-DA基准上,TAMAN在三个任务(Sports→U、S、K)中均保持优异性能,验证了其在高容量、真实世界视频数据上的可扩展性。
  • 消融实验表明,局部置信度加权与全局-局部差异最小化均对最优性能至关重要,验证了注意力机制设计的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。