Skip to main content
QUICK REVIEW

[论文解读] UC Merced Submission to the ActivityNet Challenge 2016

Yi Zhu, Shawn Newsam|arXiv (Cornell University)|Apr 11, 2017
Human Pose and Action Recognition参考文献 15被引用 7
一句话总结

本论文提出了一种用于ActivityNet Challenge 2016中未剪辑视频动作识别的晚期融合多流框架,结合手工设计的MBH特征与来自VGG16、GoogLeNet、C3D和ResNet-101的深度网络激活特征。通过加权平均和迭代重排序融合模型,该系统在验证集上达到75.14%的top-1准确率,在测试集上达到78.44%的top-1准确率,表明互补的低层次运动特征与深度学习表征能显著提升性能。

ABSTRACT

This notebook paper describes our system for the untrimmed classification task in the ActivityNet challenge 2016. We investigate multiple state-of-the-art approaches for action recognition in long, untrimmed videos. We exploit hand-crafted motion boundary histogram features as well feature activations from deep networks such as VGG16, GoogLeNet, and C3D. These features are separately fed to linear, one-versus-rest support vector machine classifiers to produce confidence scores for each action class. These predictions are then fused along with the softmax scores of the recent ultra-deep ResNet-101 using weighted averaging.

研究动机与目标

  • 为ActivityNet Challenge 2016中的长时未剪辑视频开发一个稳健的动作识别系统。
  • 探究将手工设计的动作边界直方图(MBH)特征与多种架构的深度学习特征相结合的有效性。
  • 通过晚期融合多样特征流与迭代重排序提升识别准确率。
  • 评估使用动作提议与均匀帧采样进行特征提取的对比影响。
  • 证明超深层残差网络(ResNet-101)的优越性以及MBH与深度特征之间的互补性。

提出的方法

  • 该系统采用融合五个组件的多流框架:Fisher向量编码的MBH特征、C3D的fc7特征、GoogLeNet的pool5特征、VGG16的pool5特征以及ResNet-101的softmax得分。
  • MBH特征从预计算的运动边界中提取,使用Fisher向量编码,随后通过C=100的SVM进行分类。
  • C3D特征从16帧剪辑(50%重叠)中提取,经PCA降维至500维,剪辑间取平均后通过C=1的SVM进行分类。
  • GoogLeNet与VGG16特征逐帧提取,对视频进行平均池化并归一化;VGG16特征进一步通过LCD与VLAD编码,并经PCA降维。
  • ResNet-101特征在数据集上进行微调,其softmax得分直接用于融合,而非提取的特征,因为后者表现更差。
  • 晚期融合通过加权平均组合模型输出,更准确的模型权重为其两倍,随后应用多类迭代重排序(MIR)以提升对困难样本的预测性能。

实验结果

研究问题

  • RQ1在未剪辑视频动作识别中,手工设计的动作边界直方图(MBH)特征与深度学习特征相比表现如何?
  • RQ2将多个深度网络流与MBH特征进行晚期融合,是否能超越单个模型的性能?
  • RQ3在视频分类的特征提取中,使用动作提议进行帧采样是否优于均匀采样?
  • RQ4与浅层网络相比,ResNet-101架构在长时未剪辑视频中的动作识别效果如何?
  • RQ5MBH特征在捕捉时空信息方面,与深度网络特征的互补性在多大程度上体现?

主要发现

  • ResNet-101模型在验证集上取得了71.81%的最高单模型top-1准确率,显著优于其他模型。
  • 通过晚期融合全部五个模块,验证集上的top-1准确率达到75.14%,证明了多流融合的有效性。
  • 即使MBH特征单独表现最差,引入其特征仍能提升性能,表明其与深度特征具有强烈互补性。
  • 仅融合深度网络特征(如VGG16、GoogLeNet、C3D)的性能低于融合MBH特征的组合,凸显了MBH的独特贡献。
  • 使用动作提议进行帧采样而非均匀采样会降低性能,表明均匀采样更能捕捉有代表性的视频内容。
  • 最终提交(Run 5)在测试集上达到83.1%的mAP与78.44%的top-1准确率,在ActivityNet Challenge 2016中位列顶尖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。