Skip to main content
QUICK REVIEW

[论文解读] Fully-Coupled Two-Stream Spatiotemporal Networks for Extremely Low Resolution Action Recognition

Mingze Xu, Aidean Sharghi|arXiv (Cornell University)|Jan 11, 2018
Human Pose and Action Recognition参考文献 29被引用 7
一句话总结

该论文提出了一种全耦合的双流时空卷积神经网络架构,用于极低分辨率视频(12×16像素)中的动作识别,通过堆叠光流、3D卷积(C3D)和GRU网络来建模局部和长程时间动态。该方法实现了最先进性能,在HMDB51数据集上准确率提升7.2%,在DogCentric数据集上提升3.7%,即使在不进行预训练的情况下也表现出色。

ABSTRACT

A major emerging challenge is how to protect people's privacy as cameras and computer vision are increasingly integrated into our daily lives, including in smart devices inside homes. A potential solution is to capture and record just the minimum amount of information needed to perform a task of interest. In this paper, we propose a fully-coupled two-stream spatiotemporal architecture for reliable human action recognition on extremely low resolution (e.g., 12x16 pixel) videos. We provide an efficient method to extract spatial and temporal features and to aggregate them into a robust feature representation for an entire action video sequence. We also consider how to incorporate high resolution videos during training in order to build better low resolution action recognition models. We evaluate on two publicly-available datasets, showing significant improvements over the state-of-the-art.

研究动机与目标

  • 通过最小化数据保真度来解决视频监控中的隐私问题,同时保持动作识别能力。
  • 克服在极低分辨率视频(如12×16像素)中识别人类动作的挑战,此时空间细节严重退化。
  • 开发一种深度学习框架,有效捕捉低分辨率视频序列中的空间外观和时间运动线索。
  • 通过在训练中利用高分辨率视频来学习跨域特征变换,提升模型泛化能力。
  • 设计一种鲁棒的端到端架构,集成多层次时间建模,以提升低保真度视频中的动作识别性能。

提出的方法

  • 采用双流网络,通过独立分支分别处理RGB帧和堆叠密集光流场,以独立捕捉空间与运动特征。
  • 使用3D卷积神经网络(C3D)从短视频片段中提取紧凑的时空特征(局部时间建模)。
  • 集成门控循环单元(GRU)网络,通过处理整个视频序列的C3D特征来建模长程时间依赖性。
  • 实施全耦合架构,在高分辨率与低分辨率特征学习路径之间共享参数,实现在训练过程中从高分辨率数据中迁移知识。
  • 采用求和融合策略结合双流分支的特征,性能优于拼接、最大池化或卷积融合。
  • 利用在Sport-1M数据集上预训练的C3D模型,以提升特征学习效率与性能,尤其在数据量较少的情况下。

实验结果

研究问题

  • RQ1通过结合空间与运动线索,全耦合双流时空网络能否在极低分辨率视频(12×16像素)中有效识别动作?
  • RQ2在训练中引入高分辨率视频如何提升低分辨率动作识别模型的性能?
  • RQ3在低分辨率动作识别中,局部时空特征(通过3D卷积)与长程时间建模(通过RNN)的相对贡献如何?
  • RQ4不同融合策略(求和、最大池化、拼接、卷积)在双流框架中对最终识别准确率的影响如何?
  • RQ5在微调低分辨率动作识别任务时,于高分辨率数据集上进行预训练在多大程度上能提升性能?

主要发现

  • 所提模型在HMDB51数据集上达到44.96%的准确率(使用预训练C3D),相比之前最先进方法(Multi-Siamese Embedding CNN的37.70%)提升7.2%。
  • 即使不进行预训练,该模型在HMDB51上仍达到41.04%的准确率,比先前最先进方法高出3.3%,展现出强大的泛化能力。
  • 在DogCentric数据集上,模型达到73.19%的准确率,相比之前最先进方法(Multi-Siamese Embedding CNN的69.43%)提升3.7%。
  • 与使用两层全连接层替代GRU相比,GRU组件带来约4.5%的准确率增益,凸显长程时间建模的重要性。
  • 与仅使用空间特征的一流模型相比,双流架构性能提升4.2%;与仅使用时间特征的模型相比,性能提升19.2%,证实了运动编码的价值。
  • 双流特征的求和融合策略表现最佳,在所有评估设置中均优于最大池化、拼接和卷积融合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。