Skip to main content
QUICK REVIEW

[论文解读] Deep Analysis of CNN-based Spatio-temporal Representations for Action Recognition

Chun-Fu Chen, Rameswar Panda|arXiv (Cornell University)|Oct 22, 2020
Human Pose and Action Recognition参考文献 76被引用 13
一句话总结

本文提出了一套统一的框架,用于公平比较基于2D和3D CNN的行动识别模型,在多个基准上分析了超过300个模型。结果表明,尽管效率已显著提升,但准确率增长已趋于平稳,且2D与3D模型在架构差异下展现出相近的时空表征学习能力和迁移能力。

ABSTRACT

In recent years, a number of approaches based on 2D or 3D convolutional neural networks (CNN) have emerged for video action recognition, achieving state-of-the-art results on several large-scale benchmark datasets. In this paper, we carry out in-depth comparative analysis to better understand the differences between these approaches and the progress made by them. To this end, we develop an unified framework for both 2D-CNN and 3D-CNN action models, which enables us to remove bells and whistles and provides a common ground for fair comparison. We then conduct an effort towards a large-scale analysis involving over 300 action recognition models. Our comprehensive analysis reveals that a) a significant leap is made in efficiency for action recognition, but not in accuracy; b) 2D-CNN and 3D-CNN models behave similarly in terms of spatio-temporal representation abilities and transferability. Our codes are available at https://github.com/IBM/action-recognition-pytorch.

研究动机与目标

  • 通过去除辅助组件,建立公平的基准以比较基于2D和3D CNN的行动识别模型。
  • 研究2D和3D CNN在行动识别中的相对性能及表征学习能力。
  • 评估近期模型在大规模视频数据集上准确率与效率的进展。
  • 分析不同架构所学习的时空表征在迁移性和泛化潜力方面的表现。

提出的方法

  • 开发了一套统一的训练与评估框架,实现2D与3D CNN模型的直接比较,消除了模型特异性优化和附加功能。
  • 该框架支持在多个大规模视频基准上进行训练与评估,包括Kinetics、Something-Something和Moments in Time。
  • 在300多个模型上开展了大规模消融研究,涵盖不同架构、时间聚合方法和训练协议。
  • 通过FLOPs和内存使用量评估模型效率,并通过零样本迁移和微调在下游任务中的表现评估表征质量。
  • 使用预训练的ImageNet和Kinetics权重评估迁移学习性能,同时分析从零开始训练以评估数据效率。
  • 对时间聚合模块进行了详细消融,比较其对准确率和计算成本的影响。

实验结果

研究问题

  • RQ1在公平比较设置下,2D与3D CNN模型在时空表征学习能力方面如何比较?
  • RQ2近期模型在准确率与效率方面的提升程度如何?两者之间是否存在权衡关系?
  • RQ32D与3D模型所学习的表征在不同动作识别基准间的可迁移性如何?
  • RQ4不同的时间聚合策略对模型性能和计算成本有何影响?
  • RQ5当其他因素均受控时,3D CNN是否在建模时空动态方面具有根本性优势,相比2D CNN?

主要发现

  • 模型效率实现了显著提升,FLOPs和内存使用量均大幅降低,但准确率的提升并未相应成比例。
  • 2D与3D CNN模型在不同基准上表现出几乎相同的时空表征学习能力和迁移能力。
  • 当模型在相同设置下训练时,2D与3D模型之间的性能差距缩小,表明架构差异本身并不总能带来一致优势。
  • 时间聚合模块显著影响模型效率,部分配置可将FLOPs降低高达50%,同时保持相近的准确率。
  • 在大规模数据集(如Kinetics)上进行预训练可提升零样本迁移性能,但2D与3D架构间的增益相似。
  • 从零开始训练的结果表明,2D模型可用更少的参数和更少的计算量达到具有竞争力的准确率,暗示3D CNN在表征能力上未必具有本质优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。