Skip to main content
QUICK REVIEW

[论文解读] Visual Attribute-augmented Three-dimensional Convolutional Neural Network for Enhanced Human Action Recognition

Yunfeng Wang, Wengang Zhou|arXiv (Cornell University)|May 8, 2018
Human Pose and Action Recognition参考文献 18被引用 5
一句话总结

本文提出A3D,一种视觉属性增强的3D CNN框架,通过将基于2D CNN的视觉属性检测(如物体、场景)整合到双流I3D网络中,提升人体动作识别性能。通过采用阈值加权求和的方式,将RGB与光流流的时空特征与属性感知预测进行融合,A3D在UCF101(97.4%)和HMDB51(80.5%)上实现了最先进(SOTA)的准确率,优于I3D*和先前方法。

ABSTRACT

Visual attributes in individual video frames, such as the presence of characteristic objects and scenes, offer substantial information for action recognition in videos. With individual 2D video frame as input, visual attributes extraction could be achieved effectively and efficiently with more sophisticated convolutional neural network than current 3D CNNs with spatio-temporal filters, thanks to fewer parameters in 2D CNNs. In this paper, the integration of visual attributes (including detection, encoding and classification) into multi-stream 3D CNN is proposed for action recognition in trimmed videos, with the proposed visual Attribute-augmented 3D CNN (A3D) framework. The visual attribute pipeline includes an object detection network, an attributes encoding network and a classification network. Our proposed A3D framework achieves state-of-the-art performance on both the HMDB51 and the UCF101 datasets.

研究动机与目标

  • 通过引入物体和场景等视觉属性作为辅助信息,提升视频中人体动作识别的性能。
  • 解决动作识别中的歧义问题,例如区分“Playing Dhol”与“Playing Tabla”,此时视觉属性可消除混淆。
  • 设计一种多流框架,有效融合时空3D CNN特征与基于2D的视觉属性表征。
  • 通过高效的融合策略与属性分支的选择性激活,在最小化计算开销的同时最大化性能增益。

提出的方法

  • A3D框架将双流I3D 3D CNN流水线(处理RGB与光流输入)与独立的视觉属性流水线(用于2D帧分析)相结合。
  • 3D CNN流水线采用改进的早期融合策略:空间流与时间流全连接层的特征经加权(w1=0.6, w2=0.4)后求和,再输入最终的Softmax层。
  • 视觉属性流水线使用YOLO9000(Darknet-19)进行目标检测,随后通过Word2vec、NetVLAD或平均池化进行属性编码。
  • 使用ResNet-152分类器在检测到的属性上进行微调,生成二级预测p2。
  • 最终预测p通过阈值加权求和计算:p = p1 × I(p1−T) + p2 × I(T−p1),其中I(x)为指示函数,T为全局阈值。
  • 框架在Kinetics预训练的I3D*基础上进行端到端训练,使用SGD和学习率衰减在UCF101与HMDB51上进行微调。

实验结果

研究问题

  • RQ1在存在歧义的视频案例中,如检测到的物体和场景等视觉属性是否能提升动作识别性能?
  • RQ2与晚期融合相比,3D CNN特征的早期融合在准确率与鲁棒性方面表现如何?
  • RQ3如何最优地将视觉属性预测与3D CNN输出融合,以在不显著增加计算成本的前提下提升识别性能?
  • RQ4不同的属性编码方法(Word2vec、NetVLAD、平均池化)对属性流水线性能有何影响?
  • RQ5仅在3D CNN置信度较低时选择性激活属性流水线,其影响是什么?

主要发现

  • A3D框架在UCF101和HMDB51的全部三个划分上均实现了97.4%和80.5%的最先进准确率,超越I3D*基线和先前方法。
  • 3D CNN流水线中改进的早期融合策略使UCF101(划分1)的准确率达到97.09%,优于原始的晚期融合方法(95.67%)。
  • 视觉属性流水线单独在UCF101(划分1)上达到37.10%的准确率,表明尽管属性特征存在噪声,但仍蕴含判别性信息。
  • 联合A3D框架在UCF101和HMDB51(划分1)上分别实现97.44%和79.35%的准确率,表明通过阈值融合p1与p2可有效提升性能。
  • A3D的计算开销极低,相较于I3D*,在UCF101和HMDB51上的训练时间仅分别增加8.76%和6.71%。
  • 消融实验表明,属性流水线对最终准确率有显著贡献,尤其在“Playing Dhol”与“Playing Tabla”等模糊案例中,视觉属性可有效消除歧义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。