Skip to main content
QUICK REVIEW

[论文解读] FASTER Recurrent Networks for Efficient Video Classification

Linchao Zhu, Laura Sevilla-Lara|arXiv (Cornell University)|Jun 10, 2019
Human Pose and Action Recognition参考文献 61被引用 9
一句话总结

FASTER 是一种用于高效视频分类的新框架,通过结合轻量级与高成本模型的预测结果,并引入一种新型循环单元 FAST-GRU,利用时空冗余性。该框架在保持 Kinetics、UCF-101 和 HMDB-51 数据集上最先进准确率的同时,将 FLOPs 降低超过 10 倍,通过仅使用更便宜的模型处理高达 75% 的视频片段,且不损失性能。

ABSTRACT

Typical video classification methods often divide a video into short clips, do inference on each clip independently, then aggregate the clip-level predictions to generate the video-level results. However, processing visually similar clips independently ignores the temporal structure of the video sequence, and increases the computational cost at inference time. In this paper, we propose a novel framework named FASTER, i.e., Feature Aggregation for Spatio-TEmporal Redundancy. FASTER aims to leverage the redundancy between neighboring clips and reduce the computational cost by learning to aggregate the predictions from models of different complexities. The FASTER framework can integrate high quality representations from expensive models to capture subtle motion information and lightweight representations from cheap models to cover scene changes in the video. A new recurrent network (i.e., FAST-GRU) is designed to aggregate the mixture of different representations. Compared with existing approaches, FASTER can reduce the FLOPs by over 10x? while maintaining the state-of-the-art accuracy across popular datasets, such as Kinetics, UCF-101 and HMDB-51.

研究动机与目标

  • 降低视频分类模型的高计算成本,这些模型对每个视频片段独立使用高成本网络进行处理。
  • 通过结合轻量级与高成本模型的预测结果,利用视频序列中的时间冗余性,最小化冗余计算。
  • 设计一种可学习的聚合机制,以超越简单平均法,实现对片段级别预测的更优融合。
  • 在不依赖 ImageNet 预训练的情况下,实现最先进准确率与 FLOPs 之间的最佳权衡。
  • 实现在资源受限设备上高效部署高准确率视频模型。

提出的方法

  • 提出 FASTER(用于时空冗余的特征聚合),一种框架,通过使用轻量级模型处理大部分视频片段,仅对少数片段使用高成本模型,从而降低 FLOPs。
  • 引入 FAST-GRU,一种新型门控循环单元,可保持空间分辨率,并通过通道压缩实现高效表示聚合。
  • 采用双分支架构:一个高成本模型(如 R(2+1)D-50 或 R3D-50)用于捕捉精细运动细节,一个轻量级模型用于捕捉场景级变化。
  • 使用循环网络在时间维度上整合来自两种模型的预测结果,建模长程依赖关系,超越平均池化方法。
  • 通过避免全局平均池化,保持特征图的时空分辨率,与标准 GRU 不同。
  • 端到端训练聚合网络,以学习来自不同模型复杂度的异构表示的最优融合。

实验结果

研究问题

  • RQ1能否利用视频序列中的时间冗余性,在不损失视频分类准确率的前提下降低 FLOPs?
  • RQ2可学习的循环聚合机制能否优于对片段级别预测结果进行简单平均的方法?
  • RQ3使用轻量级与高成本网络的混合模型能否在准确率/FLOPs 权衡上优于单一模型基线?
  • RQ4所提出的 FAST-GRU 架构能否比标准 RNN 更有效地整合多复杂度表示?
  • RQ5FASTER 框架能否在不依赖 ImageNet 预训练的前提下,泛化到不同主干网络和数据集?

主要发现

  • FASTER32 在 Kinetics 上实现 75.3% 的 top-1 准确率,仅需 67.7 GFLOPs × 8 个片段,优于 I3D(68.4% 准确率,432 GFLOPs),且仅使用 NL-I3D 5% 的 FLOPs。
  • FASTER16 在 14.4 GFLOPs × 16 个片段下实现 71.7% 的 top-1 准确率,超越从零训练的 I3D(68.4% 准确率),且 FLOP 成本仅为一半。
  • 该框架在保持最先进准确率的同时,将 FLOPs 降低超过 10 倍,最多有 75% 的片段由更便宜的模型处理。
  • FAST-GRU 通过有效建模长程依赖关系并保持特征图的空间分辨率,优于标准 GRU 和平均池化方法。
  • FASTER 框架具有良好的泛化能力:将 R(2+1)D-50 替换为 R3D-50 后性能略有提升,且保持相同的 FLOP 降低优势。
  • 在 UCF-101 和 HMDB-51 上,FASTER32 分别实现 96.9% 和 75.7% 的准确率,以显著更低的计算成本达到或超过最先进结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。