Skip to main content
QUICK REVIEW

[论文解读] Action recognition in still images by latent superpixel classification

Shaukat Abidi, Massimo Piccardi|arXiv (Cornell University)|Jul 30, 2015
Human Pose and Action Recognition参考文献 14被引用 3
一句话总结

该论文提出了一种新颖的动作识别方法,通过利用超像素分割和潜在结构SVM进行潜在超像素分类,实现从静态图像中识别动作。该方法首先检测类似物体的区域(即超像素),并应用预训练检测器提取特征,随后通过结构化图模型联合推断超像素类别与动作标签,在Stanford 40 Actions数据集上达到74.06%的平均准确率。

ABSTRACT

Action recognition from still images is an important task of computer vision applications such as image annotation, robotic navigation, video surveillance and several others. Existing approaches mainly rely on either bag-of-feature representations or articulated body-part models. However, the relationship between the action and the image segments is still substantially unexplored. For this reason, in this paper we propose to approach action recognition by leveraging an intermediate layer of "superpixels" whose latent classes can act as attributes of the action. In the proposed approach, the action class is predicted by a structural model(learnt by Latent Structural SVM) based on measurements from the image superpixels and their latent classes. Experimental results over the challenging Stanford 40 Actions dataset report a significant average accuracy of 74.06% for the positive class and 88.50% for the negative class, giving evidence to the performance of the proposed approach.

研究动机与目标

  • 探索图像片段(超像素)与动作类别之间的关系,该关系在现有方法中尚未得到充分研究。
  • 通过将超像素类别建模为中间属性以改进动作识别性能,从而指导最终的动作预测。
  • 解决从单帧图像中识别动作的挑战,特别是在时间信息有限的场景中,如监控或机器人应用。
  • 开发一种联合推理框架,结合超像素分类与动作识别,采用结构化预测模型。
  • 在具有挑战性的基准数据集Stanford 40 Actions上评估该方法,重点关注正负类别性能的平衡性。

提出的方法

  • 使用超像素算法对图像进行过分割,以生成空间上连贯且同质的区域。
  • 对每个超像素应用一组23个预训练的目标检测器(例如'人脸'、'自行车'、'手机'等),提取检测器得分向量作为测量值。
  • 采用潜在结构SVM框架,联合预测超像素类别与全局动作类别,通过全连接图模型建模超像素之间的依赖关系。
  • 在训练过程中,使用0-1损失函数的损失增强推理步骤,以优化正确动作类别的预测。
  • 图模型包含三层:输入测量值(检测器得分)、隐状态(超像素类别)和输出(动作类别),各节点之间存在相互依赖关系。
  • 通过一种贪心算法执行近似推理,迭代地为每个超像素最大化其类别标签,同时保持与动作预测的一致性。

实验结果

研究问题

  • RQ1超像素级别的潜在类别能否作为识别静态图像中动作的有效中间表示?
  • RQ2与独立分类或词袋方法相比,联合建模超像素与动作分类在性能上有多大提升?
  • RQ3预训练的目标检测器(在无关数据集上训练)在静态图像动作识别任务中能多大程度上实现泛化?
  • RQ4使用带有潜在变量的结构化预测模型是否能显著提升在具有挑战性且细粒度的动作数据集上的识别准确率?
  • RQ5正负类别识别之间的性能差距如何?该差距在多大程度上反映了模型的平衡性与泛化能力?

主要发现

  • 该方法在Stanford 40 Actions数据集的所有40个动作类别上,正类平均准确率达到74.06%,负类准确率达到88.50%。
  • 该模型显著优于先前工作,例如近期研究报道的55.93%准确率,证明其在极具挑战性的基准数据集上的有效性。
  • 某些动作如'划船'在正样本上的准确率超过93%,表明对可明确识别的动作具有优异性能。
  • 而'跑步'等动作的正类准确率较低(48.99%),凸显了从静态图像中识别动态动作的难度。
  • 该方法在正负预测之间保持了良好的平衡,表现为负类准确率较高,表明对类别不平衡具有鲁棒性。
  • 即使未对来自无关数据集(如显微镜、望远镜)的预训练检测器进行微调,仍能取得优异性能,表明其具备良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。