Skip to main content
QUICK REVIEW

[论文解读] Attention Distillation for Learning Video Representations

Miao Liu, Xin Chen|arXiv (Cornell University)|Apr 5, 2019
Human Pose and Action Recognition参考文献 17被引用 6
一句话总结

本文提出注意力蒸馏方法,通过将光流网络的注意力图迁移至RGB网络,从RGB帧中学习运动感知的视频表征。该方法在UCF101、HMDB51、EGTEA和20BN-V2基准上均实现了稳定的+1%准确率提升,且计算开销极低,证明注意力是视频识别中知识蒸馏的可靠载体。

ABSTRACT

We address the challenging problem of learning motion representations using deep models for video recognition. To this end, we make use of attention modules that learn to highlight regions in the video and aggregate features for recognition. Specifically, we propose to leverage output attention maps as a vehicle to transfer the learned representation from a motion (flow) network to an RGB network. We systematically study the design of attention modules, and develop a novel method for attention distillation. Our method is evaluated on major action benchmarks, and consistently improves the performance of the baseline RGB network by a significant margin. Moreover, we demonstrate that our attention maps can leverage motion cues in learning to identify the location of actions in video frames. We believe our method provides a step towards learning motion-aware representations in deep models. Our project page is available at https://aptx4869lm.github.io/AttentionDistillation/

研究动机与目标

  • 解决仅使用RGB帧的视频模型在不显式计算光流的情况下学习运动感知表征的挑战。
  • 在不增加推理成本的前提下,弥合单流RGB网络与双流模型(RGB + 光流)之间的性能差距。
  • 探究注意力图是否可作为视频识别中知识蒸馏的鲁棒且任务敏感的媒介。
  • 开发一种方法,使单流RGB网络同时保留外观和运动表征。
  • 在多个标准视频动作识别基准上评估注意力蒸馏的有效性。

提出的方法

  • 该方法使用概率注意力模块(Prob-Atten)从RGB帧生成对运动敏感的注意力图,模仿预训练光流网络的注意力图。
  • 通过在训练过程中最小化RGB网络与参考光流网络之间注意力图的L2损失,实现知识蒸馏。
  • 蒸馏后的RGB模型在推理时联合预测外观和运动注意力图,且仅使用RGB输入。
  • 该方法利用注意力图的空间和时间不变性,无需显式计算光流即可编码运动线索。
  • 对注意力图应用基于均匀分布的正则化项,以生成更平滑、更鲁棒的注意力特征。
  • 在多个数据集上使用标准I3D和ResNeXt主干网络评估该方法,并对注意力模块设计进行消融研究。

实验结果

研究问题

  • RQ1光流网络的注意力图能否有效将运动知识迁移至RGB网络?
  • RQ2注意力蒸馏在学习运动感知表征方面是否优于传统的特征蒸馏?
  • RQ3通过注意力蒸馏,单流RGB模型能否实现接近双流模型的性能?
  • RQ4不同注意力模块设计如何影响识别准确率与鲁棒性?
  • RQ5蒸馏是否会覆盖原始RGB特征,还是模型能保留有意义的外观表征?

主要发现

  • 所提出的注意力蒸馏方法在UCF101、HMDB51、EGTEA和20BN-V2数据集上,将基线RGB网络的准确率提升了约1%。
  • 即使使用性能较弱的教师模型(I3D Flow),Prob-Distill在UCF101上仍达到49.5%的准确率,优于仅RGB(49.1%)和仅光流(40.4%)的注意力I3D模型。
  • 将蒸馏后的RGB模型与参考光流网络融合(Prob-Distill + Flow I3D),进一步提升准确率,在UCF101上超过双流I3D模型0.5%,在HMDB51上超过0.7%,在20BN-V2上超过0.9%。
  • 蒸馏模型的注意力图在定性上与标准软注意力机制不同,外观注意力更准确地定位前景动作主体,运动注意力则聚焦于运动部位。
  • 该方法保留了有意义的外观特征,因为蒸馏并未覆盖原始RGB流的表征,这一点通过与光流流融合后性能提升得到证实。
  • 可视化结果表明,由于正则化作用,蒸馏模型学习到通过更分散、更清晰的注意力图来定位关键动作区域,从而增强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。