Skip to main content
QUICK REVIEW

[论文解读] Weakly Supervised Action Learning with RNN based Fine-to-coarse Modeling

Alexander Richard, Hilde Kuehne|arXiv (Cornell University)|Mar 23, 2017
Human Pose and Action Recognition被引用 8
一句话总结

该论文提出了一种基于RNN的弱监督动作识别框架,采用端到端的细粒度到粗粒度建模方法,在无需帧级标注的情况下,对未修剪视频中的动作进行定位与分类。通过迭代地重新对齐和重新估计子动作数量,该方法在时间动作分割和动作对齐任务上取得了最先进性能,在Breakfast和Hollywood Extended数据集上均优于先前方法。

ABSTRACT

We present an approach for weakly supervised learning of human actions. Given a set of videos and an ordered list of the occurring actions, the goal is to infer start and end frames of the related action classes within the video and to train the respective action classifiers without any need for hand labeled frame boundaries. To address this task, we propose a combination of a discriminative representation of subactions, modeled by a recurrent neural network, and a coarse probabilistic model to allow for a temporal alignment and inference over long sequences. While this system alone already generates good results, we show that the performance can be further improved by approximating the number of subactions to the characteristics of the different action classes. To this end, we adapt the number of subaction classes by iterating realignment and reestimation during training. The proposed system is evaluated on two benchmark datasets, the Breakfast and the Hollywood extended dataset, showing a competitive performance on various weak learning tasks such as temporal action segmentation and action alignment.

研究动机与目标

  • 解决仅提供动作顺序信息时,在未修剪视频中进行时间动作定位的挑战。
  • 通过仅利用动作序列信息的弱监督学习,减少对昂贵帧级标注的依赖。
  • 通过将动作建模为子动作序列并自适应调整每类动作的子动作数量,提升定位精度。
  • 通过结合RNN与概率建模的混合细粒度到粗粒度架构,实现在长视频序列上的鲁棒推理。
  • 在无需人工边界标注的情况下,于基准数据集上实现最先进性能。

提出的方法

  • 使用循环神经网络(RNN)从短时序片段中学习子动作的判别性表征。
  • 整合一个粗粒度概率模型,以实现全视频范围内的时序对齐与长序列推理。
  • 基于给定的动作顺序,通过在视频中均匀分布动作来初始化动作分割。
  • 通过重新训练RNN并更新每类动作的子动作数量,迭代优化帧到子动作的对齐。
  • 在每次训练迭代中,根据推断出的时序特征重新估计每类动作的子动作数量。
  • 应用迭代的重新对齐与重估循环,直至收敛,从而同时提升分割与分类性能。

实验结果

研究问题

  • RQ1基于RNN的细粒度到粗粒度架构是否能仅利用动作顺序标注,在弱监督视频中有效定位动作?
  • RQ2与固定子动作数量相比,动态调整每类动作的子动作数量是否能提升定位精度?
  • RQ3所提出的迭代重新对齐与重估过程对长而复杂的视频序列性能有何影响?
  • RQ4该方法在弱监督时间动作分割任务中,相较于现有最先进方法的性能提升程度如何?
  • RQ5子动作自适应带来的性能增益是否随数据集中动作持续时间的异质性而变化?

主要发现

  • 在Breakfast数据集上,该方法在时间动作分割任务中达到33.3%的平均帧数(Mof)准确率,优于先前最先进方法。
  • 在Hollywood Extended数据集上,该方法在时间动作分割任务中达到11.9%的Jaccard指数(IoU),显著优于未进行重估的基线GRU模型。
  • 在动作对齐任务中,该方法在Breakfast数据集上达到47.3%的Jaccard指数,在Hollywood Extended数据集上达到46.3%,超过所有对比基线。
  • 在Breakfast数据集上,迭代重估带来的性能增益更为显著,表明其对异质动作长度具有更好的适应能力。
  • 采用重估的GRU模型优于使用LSTM的ECTC系统和HTK系统,证明了子动作自适应策略的有效性。
  • 消融实验表明,结合RNN细粒度表征的粗粒度模型表现具有竞争力,验证了混合架构设计的合理性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。