Skip to main content
QUICK REVIEW

[论文解读] Joint Discovery of Object States and Manipulation Actions

Jean-Baptiste Alayrac, Josev Sivic|HAL (Le Centre pour la Communication Scientifique Directe)|Feb 9, 2017
Human Pose and Action Recognition参考文献 41被引用 6
一句话总结

本文提出一种联合学习框架,从无修剪视频中自动发现物体状态(例如,满杯/空杯)及其对应的操作动作(例如,倒水),无需人工标注。通过引入具有时间一致性的判别性聚类损失,该方法联合定位动作并聚类物体状态,通过相互监督实现两个任务性能的提升,其有效性在包含7种已发现动作与状态的新真实世界视频数据集上得到验证。

ABSTRACT

Many human activities involve object manipulations aiming to modify the object state. Examples of common state changes include full/empty bottle, open/closed door, and attached/detached car wheel. In this work, we seek to automatically discover the states of objects and the associated manipulation actions. Given a set of videos for a particular task, we propose a joint model that learns to identify object states and to localize state-modifying actions. Our model is formulated as a discriminative clustering cost with constraints. We assume a consistent temporal order for the changes in object states and manipulation actions, and introduce new optimization techniques to learn model parameters without additional supervision. We demonstrate successful discovery of seven manipulation actions and corresponding object states on a new dataset of videos depicting real-life object manipulations. We show that our joint formulation results in an improvement of object state discovery by action recognition and vice versa.

研究动机与目标

  • 从无修剪视频中自动发现物体状态与操作动作,无需人工标注。
  • 建模状态变化与动作触发之间的时间一致性,假设动作导致物体状态之间的转换。
  • 通过在联合学习框架中利用两者之间的相互监督,提升物体状态发现与动作定位的性能。
  • 通过基于文本的检索方法实现对嘈杂真实世界数据的可扩展性,用于动作片段定位。
  • 在真实生活物体操作的新数据集上展示方法的鲁棒性与有效性。

提出的方法

  • 将问题建模为带有时空约束的判别性聚类损失,以联合学习物体状态与操作动作。
  • 引入联合一致性损失,强制动作在时间上分隔不同的物体状态,确保时间上的合理性。
  • 采用非凸优化技术学习模型参数,无需额外监督,仅依赖视频片段与时间结构。
  • 在转录字幕上应用滑动窗口SVM分类器,从教学视频中检索候选动作片段。
  • 使用10词滑动窗口与二元语法特征对视频片段进行动作相关性评分,随后截取最佳窗口前5秒与后15秒的片段。
  • 对每种动作的前20个检索片段执行联合推理,利用联合模型同时优化状态与动作预测。

实验结果

研究问题

  • RQ1能否在无人工标注的情况下,从未修剪视频中联合发现物体状态与操作动作?
  • RQ2与独立发现相比,联合建模状态与动作是否能提升性能?
  • RQ3该方法能否泛化到从带解说的教学视频中自动检索的嘈杂片段?
  • RQ4时间一致性约束对所发现状态与动作的质量有何影响?
  • RQ5状态发现与动作识别之间的相互监督是否能在两个任务中均带来性能提升?

主要发现

  • 在筛选后的数据集上,联合模型在物体状态发现任务上达到36%的平均F1分数,显著优于基线方法。
  • 在嘈杂且自动检索的片段上,联合方法的平均状态发现F1为0.36,而基线方法(仅Cstrs)仅为0.24。
  • 在动作定位任务中,联合方法在嘈杂片段上达到平均F1为0.24,较基线(0.11)提升120%。
  • 在筛选后的设置中,联合方法在状态发现上达到0.62的平均F1,在动作定位上达到0.44,表明在高质量输入下表现优异。
  • 该方法成功发现7种不同的操作动作及其关联的物体状态,如“倒满咖啡杯”和“拆卸车轮”。
  • 联合建模范式可同时提升两个任务,表明状态发现可从动作识别中获益,反之亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。