[论文解读] Deep Feature Flow for Video Recognition
本文提出 Deep Feature Flow,一种快速且准确的视频识别框架,仅在稀疏的关键帧上应用计算成本较高的卷积神经网络,并通过学习到的光流场将这些关键帧的深层特征传播到相邻帧。通过端到端联合训练识别网络与光流网络,该方法在仅造成轻微精度损失的情况下,相较于逐帧推理实现了高达10倍的速度提升,显著推进了实时视频识别的发展。
Deep convolutional neutral networks have achieved great success on image recognition tasks. Yet, it is non-trivial to transfer the state-of-the-art image recognition networks to videos as per-frame evaluation is too slow and unaffordable. We present deep feature flow, a fast and accurate framework for video recognition. It runs the expensive convolutional sub-network only on sparse key frames and propagates their deep feature maps to other frames via a flow field. It achieves significant speedup as flow computation is relatively fast. The end-to-end training of the whole architecture significantly boosts the recognition accuracy. Deep feature flow is flexible and general. It is validated on two recent large scale video datasets. It makes a large step towards practical video recognition.
研究动机与目标
- 为解决将最先进图像识别网络应用于每一视频帧所带来的高计算成本问题。
- 利用视频中的时间连续性,通过光流在帧间传播深层特征。
- 端到端联合训练识别网络与光流网络,以提升精度与效率。
- 实现在自动驾驶和监控等实时视频应用中,实用化部署强大图像识别模型的目标。
提出的方法
- 该框架仅在稀疏的关键帧上运行深度卷积神经网络,从而降低计算负载。
- 关键帧的中间特征图通过学习到的光流场传播到相邻帧,类似于光流变形操作。
- 光流场通过专用的光流网络(如 FlowNet)估计,该网络与识别网络端到端联合训练。
- 在特征传播后应用识别头,以实现对任务特定特征的微调。
- 整个架构端到端训练,同时优化识别精度与光流估计性能。
- 通过调整最终任务头,该方法可适用于多种视频识别任务,包括语义分割与目标检测。
实验结果
研究问题
- RQ1能否通过光流有效将深层特征从关键帧传播到相邻帧,从而降低视频识别中的计算开销?
- RQ2与独立训练相比,识别网络与光流网络的端到端联合训练是否能提升识别精度?
- RQ3特征传播在多大程度上可减少推理时间,同时保持高识别性能?
- RQ4关键帧间隔的选择与网络架构如何影响速度与精度之间的权衡?
主要发现
- 该方法在保持视频数据集上具有竞争力的识别精度的同时,相较于逐帧推理实现了高达10倍的速度提升。
- 端到端训练显著提升了识别精度,证明了光流与识别网络联合优化的优势。
- 该框架具有高度灵活性与通用性,在 Cityscapes 数据集上的视频语义分割与 ImageNet VID 数据集上的目标检测任务中均取得成功应用。
- 在特征传播后使用单层任务头的性能几乎与使用12层头的性能相当,表明传播后的特征具有高度代表性。
- 即使在中等关键帧间隔下,该方法仍能保持高性能,支持实时推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。