Skip to main content
QUICK REVIEW

[论文解读] Spatio-Temporal Instance Learning: Action Tubes from Class Supervision

Pascal Mettes, Cees G. M. Snoek|arXiv (Cornell University)|Jul 8, 2018
Human Pose and Action Recognition参考文献 52被引用 4
一句话总结

本文提出时空实例学习(STIL),一种仅使用视频级别类别标签的弱监督视频动作定位方法。它通过带有隐变量的最大间隔目标函数,直接从帧级边界框提议中学习时空动作管,优于先前基于MIL的方法,在四个数据集上实现最先进性能,仅需极少监督信号。

ABSTRACT

The goal of this work is spatio-temporal action localization in videos, using only the supervision from video-level class labels. The state-of-the-art casts this weakly-supervised action localization regime as a Multiple Instance Learning problem, where instances are a priori computed spatio-temporal proposals. Rather than disconnecting the spatio-temporal learning from the training, we propose Spatio-Temporal Instance Learning, which enables action localization directly from box proposals in video frames. We outline the assumptions of our model and propose a max-margin objective and optimization with latent variables that enable spatio-temporal learning of actions from video labels. We also provide an efficient linking algorithm and two reranking strategies to facilitate and further improve the action localization. Experimental evaluation on four action datasets demonstrate the effectiveness of our approach for localization from weak supervision. Moreover, we show how to incorporate other supervision levels and mixtures, as a step towards determining optimal supervision strategies for action localization.

研究动机与目标

  • 解决现有弱监督动作定位方法依赖于与学习过程脱钩的预计算时空提议的局限性。
  • 实现直接从视频级别标签和帧级边界框提议中联合学习时空动作。
  • 开发一种端到端学习动作管的模型,训练过程中无需真实边界框。
  • 通过利用上下文信息和多动作信息的高效关联算法与重排序策略,提升定位准确率。
  • 探索混合监督级别(如视频标签、点、边界框)的整合,以确定以最小努力实现最优标注策略。

提出的方法

  • 提出带有隐变量的最大间隔目标函数,用于训练框级别模型,同时在帧之间强制实现时空一致性。
  • 引入一种零样本关联算法,无需真实监督即可将帧级边界框提议组合成动作管。
  • 将空间分类与时间关联解耦,受强监督方法启发,但适配弱监督设置。
  • 应用两种重排序策略:一种基于上下文特征,另一种利用视频中多动作的共现性。
  • 设计一种框架,支持在视频标签之外整合额外监督级别(如点或边界框标注)。
  • 使用隐变量学习优化模型,联合推断最优动作管及其相关得分。

实验结果

研究问题

  • RQ1是否可以在不依赖预计算时空提议的情况下有效实现时空动作定位?
  • RQ2从视频级别标签端到端学习动作管的方法与基于MIL、使用先验提议的方法相比如何?
  • RQ3在弱监督设置下,基于上下文和多动作关系的重排序在多大程度上能提升定位性能?
  • RQ4在动作定位中,结合不同监督级别(如视频标签、点、边界框)时,标注成本与性能之间的权衡如何?
  • RQ5所提方法是否能在仅使用视频级别标签的情况下,扩展到大规模未剪辑视频数据集(如Sports1M和YouTube8M)?

主要发现

  • 所提出的时空实例学习(STIL)在四个基准数据集上实现了弱监督动作定位的最先进性能。
  • STIL优于依赖预计算提议的现有MIL方法,证明了将定位整合进学习过程的优势。
  • 零样本关联算法成功在无真实监督下,从帧级提议中形成动作管。
  • 基于上下文特征和多动作信息的重排序进一步提升了定位准确率,尤其在包含多个动作的视频中表现更优。
  • 该方法即使仅使用视频级别标签,也能实现有效定位,平均每个视频标注时间减少至5秒。
  • 消融实验表明,将视频标签与最少额外监督(如点或边界框标注)结合可显著提升性能,UCF Sports数据集中点与视频标签50:50混合时,标注成本降至每视频53.75秒,同时提升准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。