Skip to main content
QUICK REVIEW

[论文解读] Video Summarisation by Classification with Deep Reinforcement Learning

Kaiyang Zhou, Tao Xiang|arXiv (Cornell University)|Jul 9, 2018
Video Analysis and Summarization被引用 9
一句话总结

本文提出了一种使用深度强化学习(DQSN)的弱监督视频摘要方法,利用视频级别的类别标签来指导帧的选择。通过结合预训练分类网络提供的全局可识别性奖励与一种新颖的密集排序奖励,该方法有效缓解了长序列中稀疏且延迟的奖励问题,在TVSum和CoSum数据集上实现了最先进性能,且推理速度优于以往的弱监督方法。

ABSTRACT

Most existing video summarisation methods are based on either supervised or unsupervised learning. In this paper, we propose a reinforcement learning-based weakly supervised method that exploits easy-to-obtain, video-level category labels and encourages summaries to contain category-related information and maintain category recognisability. Specifically, We formulate video summarisation as a sequential decision-making process and train a summarisation network with deep Q-learning (DQSN). A companion classification network is also trained to provide rewards for training the DQSN. With the classification network, we develop a global recognisability reward based on the classification result. Critically, a novel dense ranking-based reward is also proposed in order to cope with the temporally delayed and sparse reward problems for long sequence reinforcement learning. Extensive experiments on two benchmark datasets show that the proposed approach achieves state-of-the-art performance.

研究动机与目标

  • 为解决无监督和监督视频摘要方法的局限性,这些方法依赖手工设计的标准或昂贵的帧级注释。
  • 开发一种可扩展的、内容特定的摘要方法,仅使用易于标注的视频级别类别标签。
  • 通过缓解长序列中稀疏且延迟的奖励问题,改进基于强化学习的摘要方法。
  • 通过将帧选择与语义内容对齐,保持摘要中的类别可识别性。
  • 在显著减少监督信息的前提下,实现与监督方法相当的性能。

提出的方法

  • 将视频摘要建模为使用深度Q学习(DQSN)的序列决策过程,其中根据预测的未来奖励来决定移除哪些帧。
  • 使用一个辅助的循环分类网络,通过监督交叉熵损失进行训练,以提供基于摘要是否仍能被正确分类到其视频类别的全局可识别性奖励。
  • 提出一种新颖的密集排序奖励,通过评估移除某帧后对真实类别分类排名的影响,来衡量每帧的相对重要性。
  • 将全局可识别性奖励与密集局部奖励相结合,以改善信用分配,并在长序列中实现有效训练。
  • 使用经验回放和目标网络的深度Q学习训练DQSN,以稳定学习过程。
  • 采用两阶段训练流程:首先在视频级别标签上预训练分类网络,然后使用强化学习微调DQSN。

实验结果

研究问题

  • RQ1是否可以仅使用视频级别类别标签而无需帧级注释,有效训练视频摘要?
  • RQ2在长序列强化学习中,如何缓解视频摘要任务中稀疏且时间延迟的奖励问题?
  • RQ3基于分类排名变化的密集帧级奖励是否能相比仅使用全局奖励,显著提升摘要性能?
  • RQ4与监督和无监督基线方法相比,所提方法在性能和可扩展性方面表现如何?
  • RQ5该模型是否能在保持语义内容和时间连贯性的前提下,泛化到多样化的视频内容?

主要发现

  • 所提出的DQSN方法在TVSum和CoSum数据集上均实现了最先进性能,优于现有的无监督和弱监督方法。
  • 与之前的SOTA方法DR-DSN相比,DQSN在TVSum上的F1分数提升了1.0%,在CoSum上提升了4.3%。
  • DQSN在两个数据集上均比弱监督方法Backprop-Grad高出5.9%,证明了基于强化学习与密集奖励框架的有效性。
  • 消融实验表明,全局奖励与局部奖励(r^g + r^l)的结合效果最佳,其中局部奖励显著提升了帧选择的准确性。
  • 由于仅需一次前向传播且内存使用更少,DQSN的推理速度超过Backprop-Grad两倍以上,每段视频仅需1.43秒(对比3.21秒)。
  • 定性结果表明,DQSN能有效捕捉与类别相关的帧(如梳理毛发的场景),并保持时间上的叙事连贯性,同时避免了其他方法错误选择的无关帧。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。