Skip to main content
QUICK REVIEW

[论文解读] Learning from Temporal Gradient for Semi-supervised Action Recognition

Junfei Xiao, Longlong Jing|arXiv (Cornell University)|Nov 25, 2021
Human Pose and Action Recognition参考文献 58被引用 9
一句话总结

本文提出了一种半监督动作识别方法,利用时间梯度(TG)作为额外模态,以在有限标注视频数据下提升特征学习效果。通过在TG与RGB特征之间应用逐块密集知识蒸馏,并结合跨模态对比学习,该模型在Kinetics-400、UCF-101和HMDB-51数据集上实现了最先进性能,且无需额外推理计算或参数。

ABSTRACT

Semi-supervised video action recognition tends to enable deep neural networks to achieve remarkable performance even with very limited labeled data. However, existing methods are mainly transferred from current image-based methods (e.g., FixMatch). Without specifically utilizing the temporal dynamics and inherent multimodal attributes, their results could be suboptimal. To better leverage the encoded temporal information in videos, we introduce temporal gradient as an additional modality for more attentive feature extraction in this paper. To be specific, our method explicitly distills the fine-grained motion representations from temporal gradient (TG) and imposes consistency across different modalities (i.e., RGB and TG). The performance of semi-supervised action recognition is significantly improved without additional computation or parameters during inference. Our method achieves the state-of-the-art performance on three video action recognition benchmarks (i.e., Kinetics-400, UCF-101, and HMDB-51) under several typical semi-supervised settings (i.e., different ratios of labeled data).

研究动机与目标

  • 解决现有半监督视频方法将视频视为3D图像而未利用时间动态性所导致的性能不佳问题。
  • 利用时间梯度(TG)中编码的丰富运动信号,其具有颜色不变性并能明确表示细粒度运动。
  • 通过知识蒸馏和对比学习在RGB与TG模态之间强制一致性,提升低标签设置下的泛化能力。
  • 设计一种方法,尽管训练时使用TG,但推理时仅使用RGB模型,从而保持推理效率。
  • 在最小架构与计算开销下,于多个基准测试中实现最先进性能。

提出的方法

  • 引入时间梯度(TG)作为新模态,定义为连续RGB帧之间的差异:$TG = x_t^{RGB} - x_{t+n}^{RGB}$,以捕捉细粒度运动信号。
  • 应用逐块密集知识蒸馏:对齐RGB学生网络与TG教师网络中对应残差块的特征,以传递运动表征。
  • 在蒸馏过程中对TG分支使用停止梯度操作,以保留运动特异性特征,并防止教师模型性能退化。
  • 采用温度缩放的对比损失,在RGB与TG特征序列之间实施跨模态对比学习,以强制高层表征一致性。
  • 采用伪标签融合策略,结合RGB与TG模型的预测结果,生成更可靠的伪标签用于训练。
  • 集成训练技巧,包括监督预热、初始学习率预热和PreciseBN,以稳定训练并提升收敛性。

实验结果

研究问题

  • RQ1在低标签设置下,时间梯度(TG)是否可作为比RGB更有效的模态用于半监督视频动作识别?
  • RQ2如何在不增加推理成本的前提下,有效将TG中的细粒度运动表征传递至基于RGB的学生模型?
  • RQ3在RGB与TG特征之间强制多模态一致性对模型泛化能力和性能有何影响?
  • RQ4不同训练策略(如伪标签融合与对比学习)在半监督设置中对性能提升的贡献如何?
  • RQ5哪些消融设置(如逐块对齐、对比损失中的温度超参)可实现最优性能与稳定性?

主要发现

  • 在仅使用20%标注数据的条件下,使用时间梯度作为输入在UCF-101上的Top-1准确率比RGB高出25%,证明其在低数据场景下的优越性。
  • 在所有残差块上实施逐块密集知识蒸馏,相比基线FixMatch,Top-1准确率提升20.5%(从54.1%提升至74.6%)。
  • 所提方法在Kinetics-400、UCF-101和HMDB-51所有标注数据比例下均实现最先进性能,优于先前方法。
  • 监督预热是最有效的训练技巧,使Top-1准确率提升2.7%(从71.9%提升至74.6%),并有助于缓解训练初期伪标签质量差的问题。
  • 使用温度为0.2或0.5的对比学习可获得最优性能,而极端值(0.1或1.0)会降低结果。
  • 若在蒸馏中移除停止梯度操作,Top-1准确率将下降14.6%(从74.6%降至60.0%),证明其在保持运动特征质量方面具有关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。