[论文解读] EXMOVES: Classifier-based Features for Scalable Action Recognition
该论文提出 EXMOVES,一种可扩展的视频动作识别框架,通过使用基于分类器的中层特征(源自在单个正样本视频片段和大量负样本视频上训练的原型-SVM)实现。通过用快速的线性分类替代计算成本高昂的模板匹配,EXMOVES 在 HMDB51 和 Hollywood-2 数据集上实现了最先进(SOTA)的准确率,同时将推理成本降低了一个数量级以上的量级,从而实现了大规模视频数据库中的高效识别。
This paper introduces EXMOVES, learned exemplar-based features for efficient recognition of actions in videos. The entries in our descriptor are produced by evaluating a set of movement classifiers over spatial-temporal volumes of the input sequence. Each movement classifier is a simple exemplar-SVM trained on low-level features, i.e., an SVM learned using a single annotated positive space-time volume and a large number of unannotated videos. Our representation offers two main advantages. First, since our mid-level features are learned from individual video exemplars, they require minimal amount of supervision. Second, we show that simple linear classification models trained on our global video descriptor yield action recognition accuracy approaching the state-of-the-art but at orders of magnitude lower cost, since at test-time no sliding window is necessary and linear models are efficient to train and test. This enables scalable action recognition, i.e., efficient classification of a large number of different actions even in large video databases. We show the generality of our approach by building our mid-level descriptors from two different low-level feature representations. The accuracy and efficiency of the approach are demonstrated on several large-scale action recognition benchmarks.
研究动机与目标
- 解决缺乏可扩展的动作识别系统以处理具有高类内差异性的大规模非约束视频数据库的问题。
- 在保持高准确率的同时,降低视频动作识别的训练和推理成本。
- 开发一种需要极少人工监督的中层视频表征,并支持高效的线性分类。
- 通过与现有方法(如 Action Bank)相比显著降低计算开销,实现动作识别的大规模部署。
提出的方法
- EXMOVES 通过在时空视频体积上评估一组运动分类器——原型-SVM——来构建全局视频描述符。
- 每个原型-SVM 在单个标注的正样本视频片段和大量未标注的负样本视频上进行训练,使用低层特征(如 HOG-HOF-STIPs 或密集轨迹)。
- 描述符条目表示与训练原型中相似的运动模式的存在,形成语义丰富的中层表征。
- 随后在完整描述符向量上训练线性 SVM 以进行动作分类,从而实现快速的训练和推理。
- 通过递归特征消除(RFE)进行特征选择,识别出最具判别性的原型,结果表明仅使用 100 个原型即可保持接近最先进(SOTA)的性能。
- 该方法对低层特征类型不敏感,可与先进特征(如密集轨迹)无缝集成。
实验结果
研究问题
- RQ1基于原型-SVM 的中层视频表征是否能在极少人工监督下实现最先进(SOTA)的动作识别准确率?
- RQ2在大规模设置下,EXMOVES 的计算成本与现有方法(如 Action Bank)相比如何?
- RQ3在 EXMOVES 上训练的线性分类器在性能上是否显著优于非线性模型以及直接的低层特征学习方法?
- RQ4需要多少基于原型的特征才能维持高准确率?特征集的冗余结构如何?
主要发现
- 在 HMDB51 数据集上,使用相同的密集轨迹特征时,EXMOVES 相较于 Action Bank 实现了 41.6% 的准确率相对提升。
- 在 HMDB51 上对单个类别训练线性 SVM 仅需 6.2 秒,而使用密集轨迹的词袋(BOW)表示训练非线性 SVM 需要 25 分钟,速度提升 250 倍。
- 在 EXMOVES 上测试线性 SVM 每个视频仅需 7 毫秒,而非线性 SVM 因依赖支持向量而慢两个数量级以上。
- 使用单个 CPU 提取 UT-I 数据集全部 EXMOVES 特征仅耗时 14 小时,而 Action Bank 需要超过 41 天。
- 即使仅使用 100 个原型,EXMOVES 也能保持接近最先进(SOTA)的准确率,仅在原型数低于 50 个时出现显著下降。
- 该方法在不同低层特征类型上均表现出良好的泛化能力,无论使用 HOG-HOF-STIPs 还是密集轨迹,均展现出优异性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。