[论文解读] Human Action Recognition using Local Two-Stream Convolution Neural Network Features and Support Vector Machines
本文提出一种结合两流卷积神经网络特征提取与线性支持向量机的行人动作识别方法,利用来自RGB和光流输入的局部时空特征。通过应用光流缩放和裁剪填充预处理,并在完整视频上下文中训练SVM,该方法在HMDB51和UCF101等复杂数据集上实现了显著的准确率提升,表明全局SVM融合优于简单的裁剪级别投票。
This paper proposes a simple yet effective method for human action recognition in video. The proposed method separately extracts local appearance and motion features using state-of-the-art three-dimensional convolutional neural networks from sampled snippets of a video. These local features are then concatenated to form global representations which are then used to train a linear SVM to perform the action classification using full context of the video, as partial context as used in previous works. The videos undergo two simple proposed preprocessing techniques, optical flow scaling and crop filling. We perform an extensive evaluation on three common benchmark dataset to empirically show the benefit of the SVM, and the two preprocessing steps.
研究动机与目标
- 通过深度特征提升行人动作识别性能,且无需依赖大量计算资源。
- 探究在局部裁剪特征提取的全局视频表示上训练线性SVM是否优于裁剪级别预测的共识投票。
- 评估两种简单预处理技术——光流缩放和裁剪填充——对多样化数据集上识别准确率的影响。
- 证明所提方法在复杂、真实世界动作数据集上的泛化能力优于以往的工程化方法与深度学习方法。
提出的方法
- 使用预训练的I3D网络从采样的视频片段中提取RGB和光流输入的局部时空特征。
- 应用光流缩放以归一化光流幅值,提升不同运动强度视频之间的特征一致性。
- 采用裁剪填充处理以应对视频时长差异,通过填充将较短片段补全至固定长度,保留时间上下文。
- 将所有裁剪区域的局部特征拼接为全局视频表示,形成用于分类的固定长度向量。
- 在全局特征表示上训练线性SVM以执行动作分类,使用完整视频上下文而非裁剪级别投票。
- 在KTH、HMDB51和UCF101数据集上使用标准划分和评估指标进行方法评估,并开展关于预处理和分类器选择的消融研究。
实验结果
研究问题
- RQ1与裁剪级别预测的多数投票相比,在局部裁剪特征提取的全局完整视频表示上训练线性SVM是否能提升动作识别准确率?
- RQ2光流缩放和裁剪填充预处理技术在动作时间相似性各异的数据集中对识别性能有何影响?
- RQ3能否通过使用标准I3D特征和SVM的轻量化、高效方法,在不依赖高端硬件或大规模数据的情况下,在基准数据集上实现具有竞争力的性能?
- RQ4与以往的最先进方法相比,所提方法在复杂、真实世界数据集(如HMDB51和UCF101)上的泛化能力是否更优?
主要发现
- 在完整视频上下文中基于SVM的分类显著优于简单的裁剪级别投票,尤其在HMDB51和UCF101等复杂数据集中表现更优,此时空间和时间上下文更为关键。
- 在KTH数据集中,该方法实现了96.6%的最高平均准确率,优于大多数先前方法,仅略逊于一种最先进方法。
- 在HMDB51数据集中,该方法实现了62.8%的最高平均准确率,表明其在空间和时间分辨率有限的情况下仍具备强大的泛化能力。
- 在UCF101数据集中,该方法在SVM和预处理下达到86.5%的准确率,较基线提升6个百分点。
- 光流缩放和裁剪填充在KTH和HMDB51上提升了性能,因为这些数据集中动作的时间相似性较高;但在UCF101上效果有限,因为动作间的时间差异更大。
- 消融研究证实,两个预处理步骤以及SVM融合策略均为性能提升的关键因素,尤其在具有挑战性的现实场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。