Skip to main content
QUICK REVIEW

[论文解读] Beyond Short Snippets: Deep Networks for Video Classification

Joe Yue-Hei Ng, Matthew Hausknecht|arXiv (Cornell University)|Mar 31, 2015
Human Pose and Action Recognition参考文献 23被引用 254
一句话总结

本文提出了一种深度神经网络架构——具体为时间特征池化和基于LSTM的模型——利用完整时长的视频片段(最多120帧,约2分钟)以提升视频分类性能。通过结合CNN处理的帧特征与光流信息,并建模长程时间依赖关系,该方法在UCF-101(88.6%)和Sports-1M(73.1%)基准上达到最先进性能,显著优于以往使用短片段的方法。

ABSTRACT

Convolutional neural networks (CNNs) have been extensively applied for image recognition problems giving state-of-the-art results on recognition, detection, segmentation and retrieval. In this work we propose and evaluate several deep neural network architectures to combine image information across a video over longer time periods than previously attempted. We propose two methods capable of handling full length videos. The first method explores various convolutional temporal feature pooling architectures, examining the various design choices which need to be made when adapting a CNN for this task. The second proposed method explicitly models the video as an ordered sequence of frames. For this purpose we employ a recurrent neural network that uses Long Short-Term Memory (LSTM) cells which are connected to the output of the underlying CNN. Our best networks exhibit significant performance improvements over previously published results on the Sports 1 million dataset (73.1% vs. 60.9%) and the UCF-101 datasets with (88.6% vs. 88.0%) and without additional optical flow information (82.6% vs. 72.8%).

研究动机与目标

  • 通过建模完整视频中的长程时间依赖关系,而非依赖短片段,以提升视频分类性能。
  • 探究从扩展帧序列中学习的全局视频级表征是否优于帧级聚合方法。
  • 评估在深度学习架构中结合光流作为显式运动编码的有效性。
  • 比较特征池化与循环架构(LSTM)在捕捉视频时间演化方面的性能表现。
  • 确定在与光流结合时,低帧率(1 fps)是否可有效使用以降低计算成本,同时保持准确性。

提出的方法

  • 以1 fps处理视频帧,以降低计算成本,同时通过每秒仅使用一帧来保持效率与时间上下文。
  • 使用2D CNN从每帧提取空间特征,随后通过时间特征池化(如最大池化)将帧级特征聚合为全局视频描述符。
  • 使用长短期记忆(LSTM)网络建模帧间序列依赖关系,LSTM隐藏状态随时间演化以捕捉长程时间动态。
  • 将图像帧特征与光流图作为输入,同时输入至池化模型和LSTM模型,以显式编码运动信息。
  • 通过逐步扩展小型网络并进行微调来训练模型,实现在完整视频上端到端学习,无需依赖短片段。
  • 在顶层LSTM层应用时间反向传播,但不通过CNN层,从而将梯度流限制在循环组件内。

实验结果

研究问题

  • RQ1在完整视频(最多120帧)上训练的深度神经网络是否能显著提升视频分类准确率,相比仅使用短片段的模型?
  • RQ2将光流作为显式运动编码是否能提升性能,尤其是在与LSTM等循环架构结合时?
  • RQ3当使用光流来保留运动信息时,将帧率降低至1 fps对分类性能有何影响?
  • RQ4循环模型(LSTM)在捕捉视频序列中的长程时间依赖关系方面是否优于简单的时序池化方法?
  • RQ5光流的优势是否依赖于视频质量?在噪声较大或未修剪的视频(如Sports-1M数据集中的视频)中是否仍具有效性?

主要发现

  • 所提出的基于LSTM的模型在UCF-101上达到88.6%的准确率,超越此前最先进方法(使用SVM的两流融合方法)的88.0%。
  • 使用120帧和光流的模型在UCF-101上达到88.2%的准确率,显著优于单帧CNN基线模型的73.0%。
  • 在Sports-1M数据集上,结合光流的LSTM模型达到73.1%的准确率,远超此前最先进水平的60.9%。
  • 光流在UCF-101上带来的性能增益(82.6% vs. 88.2%)大于在Sports-1M上,原因在于UCF-101视频质量更高且动作内容更一致。
  • 即使光流图存在噪声,LSTM模型仍能从运动信息中获益,表明其对低质量运动特征具有鲁棒性。
  • 当足够的时间上下文得以保留时,降低帧率至1 fps并不会降低性能,即使与光流结合使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。