Skip to main content
QUICK REVIEW

[论文解读] Aligning Correlation Information for Domain Adaptation in Action Recognition

Yuecong Xu, Jianfei Yang|arXiv (Cornell University)|Jul 11, 2021
Human Pose and Action Recognition参考文献 66被引用 5
一句话总结

本文提出了一种对抗性相关性自适应网络(ACAN),通过利用像素相关性差异(PCD)在域之间对齐时空相关性特征,从而提升动作识别中的域自适应性能。ACAN在现有数据集和新引入的跨域视频数据集(HMDB-ARID)上均取得了最先进性能,尤其在由恶劣视频条件引起的显著域偏移情况下表现出显著的准确率提升。

ABSTRACT

Domain adaptation (DA) approaches address domain shift and enable networks to be applied to different scenarios. Although various image DA approaches have been proposed in recent years, there is limited research towards video DA. This is partly due to the complexity in adapting the different modalities of features in videos, which includes the correlation features extracted as long-term dependencies of pixels across spatiotemporal dimensions. The correlation features are highly associated with action classes and proven their effectiveness in accurate video feature extraction through the supervised action recognition task. Yet correlation features of the same action would differ across domains due to domain shift. Therefore we propose a novel Adversarial Correlation Adaptation Network (ACAN) to align action videos by aligning pixel correlations. ACAN aims to minimize the distribution of correlation information, termed as Pixel Correlation Discrepancy (PCD). Additionally, video DA research is also limited by the lack of cross-domain video datasets with larger domain shifts. We, therefore, introduce a novel HMDB-ARID dataset with a larger domain shift caused by a larger statistical difference between domains. This dataset is built in an effort to leverage current datasets for dark video classification. Empirical results demonstrate the state-of-the-art performance of our proposed ACAN for both existing and the new video DA datasets.

研究动机与目标

  • 解决视频动作识别中缺乏有效域自适应方法的问题,特别是在大域偏移情况下的挑战。
  • 克服视频特征中域偏移的挑战,尤其是捕捉长程时空依赖关系的相关性特征。
  • 引入一个新的视频数据集HMDB-ARID,其因低光照、模糊等恶劣条件导致显著域偏移,以更有效地评估域自适应方法。
  • 通过联合对齐源域和目标域的相关性特征分布,提升动作识别模型的可迁移性。
  • 证明仅对相关性特征进行对齐,而非仅对空间或时间特征对齐,可在跨域视频识别中带来显著的性能提升。

提出的方法

  • 提出一种对抗性相关性自适应网络(ACAN),通过对抗训练显式对齐源域和目标域之间的相关性特征。
  • 定义一种新度量指标——像素相关性差异(PCD),用于衡量并最小化不同域中相同动作的相关性特征分布差异。
  • 将PCD计算为相关性特征图(PCMs)的协方差,利用核估计方法捕捉联合分布差异。
  • 提出一种简化变体ACAN(l2-norm),通过最小化PCMs范数与共享标量R之间的L2距离来降低计算成本。
  • 端到端训练ACAN,采用联合损失函数:分类损失、空间-时间特征的域差异损失,以及基于PCD的相关性对齐损失。
  • 利用非局部网络提取建模时空维度上长程依赖关系的相关性特征。

实验结果

研究问题

  • RQ1对抗性对齐相关性特征是否能提升视频动作识别中的域自适应性能?
  • RQ2像素相关性差异(PCD)在捕捉和最小化不同视频域中相关性特征的域偏移方面有多有效?
  • RQ3所提出的ACAN方法在具有大域偏移的数据集(如黑暗或低质量视频)上是否优于现有域自适应基线方法?
  • RQ4与仅对齐空间或时间特征相比,包含相关性特征对齐的性能增益如何?
  • RQ5基于范数匹配的简化PCD变体(ACAN l2-norm)是否能在降低计算成本的同时保持较强的性能?

主要发现

  • ACAN在UCF→HMDB和HMDB→ARID两个域自适应基准上均取得了最先进性能。
  • 消融实验表明,移除PCD后,UCF→HMDB准确率下降1.6%,HMDB→ARID下降5.4%,证明了PCD的关键作用。
  • ACAN(l2-norm)变体在性能上显著优于ACAN-Base(无PCD),但不及完整PCD版本的ACAN,验证了基于核的PCD的有效性。
  • 使用类激活图(CAM)的定性分析显示,ACAN能成功聚焦于黑暗目标视频中的相关身体部位(如挥舞的手),而基线模型则关注背景或整个人物。
  • t-SNE可视化结果表明,ACAN生成的源域和目标域数据点聚类更密集、更具可分性,且源域与目标域数据点对齐效果更好。
  • 新引入的HMDB-ARID数据集相比现有数据集表现出更大的域偏移,尤其由于低光照、模糊等恶劣条件,可作为未来视频域自适应研究的有力基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。