Skip to main content
QUICK REVIEW

[论文解读] An end-to-end generative framework for video segmentation and recognition

Hilde Kuehne, Jüergen Gall|arXiv (Cornell University)|Sep 7, 2015
Human Pose and Action Recognition参考文献 31被引用 5
一句话总结

本文提出了一种端到端的生成式框架,将降维的Fisher向量(FVs)与隐马尔可夫模型(HMMs)相结合,用于视频动作分割与识别。通过利用FVs的统计特性以实现与高斯混合模型(GMMs)的高效建模,该方法在大规模数据集上实现了最先进(SOTA)的性能,当训练数据充足时,识别准确率相比先前方法最高提升30%。

ABSTRACT

We describe an end-to-end generative approach for the segmentation and recognition of human activities. In this approach, a visual representation based on reduced Fisher Vectors is combined with a structured temporal model for recognition. We show that the statistical properties of Fisher Vectors make them an especially suitable front-end for generative models such as Gaussian mixtures. The system is evaluated for both the recognition of complex activities as well as their parsing into action units. Using a variety of video datasets ranging from human cooking activities to animal behaviors, our experiments demonstrate that the resulting architecture outperforms state-of-the-art approaches for larger datasets, i.e. when sufficient amount of data is available for training structured generative models.

研究动机与目标

  • 为解决未结构化模型在长视频记录中识别复杂、序列性人类活动的局限性。
  • 提升高维稀疏视觉特征(如Fisher向量)与结构化生成模型(如HMMs和GMMs)之间的兼容性。
  • 证明当训练数据充足时,结构化生成模型可超越判别式基线模型。
  • 在包括人类日常活动与动物行为在内的多样化视频数据集上,系统性地评估所提出的框架。
  • 表明降维FVs可提升时间建模任务中识别与分割的准确性。

提出的方法

  • 该方法使用降维Fisher向量作为从视频片段中提取的紧凑、低维视觉表征,提升与GMMs的兼容性。
  • 采用基于隐马尔可夫模型(HMMs)的结构化时间模型,通过HTK工具包进行训练,用于序列建模。
  • 该框架将GMMs与降维FVs相结合,利用FVs的统计特性,使其特别适合高斯混合建模。
  • 特征提取使用HOGHOF与密集轨迹特征(DTFs),随后通过空间金字塔池化与L2归一化,以增强表征的紧凑性。
  • 系统实现动作识别与复杂活动时间分割的端到端训练与推理。
  • 评估采用多个数据集的标准基准,包括ADL、Breakfast、MPII Cooking与CRIM13,使用帧级与段级准确率指标。

实验结果

研究问题

  • RQ1降维Fisher向量能否提升HMM等结构化生成模型在视频动作识别中的性能?
  • RQ2所提出的端到端生成式框架是否在大规模视频数据集上超越判别式基线模型?
  • RQ3与最先进方法相比,该系统在将复杂活动分割为动作单元方面的表现如何?
  • RQ4在何种数据量条件下,结构化生成模型可超越判别式模型用于视频识别任务?
  • RQ5Fisher向量的统计特性在多大程度上增强了基于GMM的时间动作识别建模?

主要发现

  • 在使用降维FVs与HMMs时,该框架在大型数据集(如Breakfast与CRIM13)上的识别准确率相比最先进方法提升约20–30%。
  • 在Breakfast数据集上,系统在使用256个GMM分量时达到了98.7%的识别准确率,显著优于[12]中报告的先前SOTA方法的40.5%。
  • 在分割任务中,该系统在CRIM13数据集上相比最佳基线模型实现了27.5%的性能提升,表明其在长连续视频序列上的强大表现。
  • 该方法在小数据集(如ADL与Olympics)上表现欠佳,表明性能增益具有数据依赖性,需充足的训练样本。
  • 使用完整FVs的SVM分类性能优于降维FVs,但仍比基于HTK的HMM系统低20–30%的准确率,凸显了结构化建模的优势。
  • 结果证实,当训练数据充足时,结构化生成模型可超越判别式模型,逆转了判别式模型在低数据环境下占主导地位的趋势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。