Skip to main content
QUICK REVIEW

[论文解读] AdaFrame: Adaptive Frame Selection for Fast Video Recognition

Zuxuan Wu, Caiming Xiong|arXiv (Cornell University)|Nov 29, 2018
Multimodal Machine Learning Applications参考文献 41被引用 16
一句话总结

AdaFrame 提出了一种基于强化学习的帧选择框架,可自适应地为快速视频识别选择信息量丰富的视频帧。通过使用带有全局记忆的LSTM来引导帧选择,并采用策略梯度训练,该方法在FCVID和ActivityNet数据集上仅使用8.21帧和8.65帧的情况下实现了最先进(SOTA)的准确率,同时将计算量减少了高达90.6%,且性能保持不变。

ABSTRACT

We present AdaFrame, a framework that adaptively selects relevant frames on a per-input basis for fast video recognition. AdaFrame contains a Long Short-Term Memory network augmented with a global memory that provides context information for searching which frames to use over time. Trained with policy gradient methods, AdaFrame generates a prediction, determines which frame to observe next, and computes the utility, i.e., expected future rewards, of seeing more frames at each time step. At testing time, AdaFrame exploits predicted utilities to achieve adaptive lookahead inference such that the overall computational costs are reduced without incurring a decrease in accuracy. Extensive experiments are conducted on two large-scale video benchmarks, FCVID and ActivityNet. AdaFrame matches the performance of using all frames with only 8.21 and 8.65 frames on FCVID and ActivityNet, respectively. We further qualitatively demonstrate learned frame usage can indicate the difficulty of making classification decisions; easier samples need fewer frames while harder ones require more, both at instance-level within the same class and at class-level among different categories.

研究动机与目标

  • 通过仅选择每段输入视频中的相关帧,降低视频识别中的计算成本,同时不牺牲准确性。
  • 解决弱监督视频分类中的挑战,即帧的重要性未被显式标注。
  • 学习动态的、与输入相关的帧使用策略,以适应视频的复杂度和类别难度。
  • 通过预测观察更多帧的未来效用,在推理阶段实现自适应推理。
  • 证明帧使用量与各类别之间及类别内部的识别难度相关。

提出的方法

  • AdaFrame 采用一种增强全局记忆模块的LSTM网络,该模块存储下采样视频帧的上下文信息,以指导帧的选择。
  • 该模型使用策略梯度强化学习训练帧选择策略,最大化一个奖励函数,该函数随着每帧的增加而提升分类置信度。
  • 在每个时间步,智能体预测下一个要观察的帧,生成分类输出,并计算继续推理的预期未来效用。
  • 在推理阶段,模型利用预测的效用分数决定何时停止,从而实现自适应前瞻,减少计算量。
  • 全局记忆由固定数量的下采样帧构建,消融实验表明16帧在准确率与开销之间达到最佳平衡。
  • 采用一种新颖的奖励函数,通过测量随时间推移的真值类别置信度提升来衡量,以鼓励选择信息量丰富的帧。

实验结果

研究问题

  • RQ1强化学习智能体能否学会选择最小帧集,以在多样化视频输入下保持高识别准确率?
  • RQ2在弱监督视频识别中,引入全局记忆在多大程度上改善了帧选择策略的学习?
  • RQ3帧使用量在多大程度上与视频分类任务的内在难度相关?
  • RQ4基于预测效用的自适应推理是否优于固定策略或基于熵的停止标准?
  • RQ5AdaFrame 在大规模基准测试中与均匀采样及其他帧选择基线相比表现如何?

主要发现

  • AdaFrame 在FCVID和ActivityNet上均实现了最先进(SOTA)的平均精度均值(mAP),在仅使用8.21帧和8.65帧的平均情况下,性能与或超过均匀采样基线。
  • 与均匀采样相比,该框架在FCVID和ActivityNet上平均分别将计算成本降低了58.9%和63.3%,峰值节省高达90.6%。
  • 不同类别之间以及同一类别内部的帧使用量存在显著差异,更难的样本(如存在相机运动或杂乱背景的视频)需要更多帧才能正确分类。
  • AdaFrame 展现出灵活性,偶尔会向后跳转时间(在FCVID上42.8%的视频中发生),以重新表达过去的信息,表明其具备有效的时序推理能力。
  • 消融实验证实,全局记忆提升了性能,16帧在准确率与开销之间提供了最佳平衡。
  • 所提出的奖励函数通过测量随时间推移的置信度增益,优于仅基于当前预测置信度或状态转移差异的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。