[论文解读] Human Activity Learning using Object Affordances from RGB-D Videos
本文提出了一种基于马尔可夫随机场与结构化SVM的联合学习框架,用于从RGB-D视频中识别人体活动与物体功能,将时间分割视为隐变量。在120段视频的端到端活动识别中,该方法实现了81.8%的精确率与80.0%的召回率,证明了物体功能、交互作用与时间上下文在实现鲁棒的长序列活动理解中的重要性。
Human activities comprise several sub-activities performed in a sequence and involve interactions with various objects. This makes reasoning about the object affordances a central task for activity recognition. In this work, we consider the problem of jointly labeling the object affordances and human activities from RGB-D videos. We frame the problem as a Markov Random Field where the nodes represent objects and sub-activities, and the edges represent the relationships between object affordances, their relations with sub-activities, and their evolution over time. We formulate the learning problem using a structural SVM approach, where labeling over various alternate temporal segmentations are considered as latent variables. We tested our method on a dataset comprising 120 activity videos collected from four subjects, and obtained an end-to-end precision of 81.8% and recall of 80.0% for labeling the activities.
研究动机与目标
- 解决在RGB-D视频中识别涉及顺序子活动与物体交互的复杂、长时序人体活动的挑战。
- 克服先前研究将物体检测与活动识别视为独立任务的局限,尤其在处理时间可变性与视角变化方面。
- 通过将物体功能(如可触及、可倾倒)建模为随时间动态演变的属性,提升识别性能。
- 通过将多种时间分割视为隐变量,将时间分割的不确定性整合到学习过程中,避免依赖单一固定分割。
- 展示子活动、物体功能、物体-物体交互与时间动态之间的相互上下文对提升识别准确性的价值。
提出的方法
- 将活动与功能标注任务建模为具有两类节点的马尔可夫随机场(MRF):表示功能的物体节点与表示子活动的节点。
- 在MRF中定义边以建模成对关系:物体-物体交互、物体-子活动交互,以及时间上的依赖关系。
- 采用结构化SVM框架联合学习模型参数,将多种候选时间分割上的标注视为隐变量。
- 使用三种方法生成多样化的分割假设:均匀分割、基于图的分割(联合位移)与基于图的分割(联合速度)。
- 通过投票或融合策略结合多种分割的预测结果,以提升鲁棒性并处理分割不确定性。
- 利用RGB-D数据提取3D人体姿态与物体位置,从而在遮挡与杂乱环境下实现对功能与子活动状态的鲁棒估计。
实验结果
研究问题
- RQ1如何在RGB-D视频的长时序人体活动中,有效建模物体功能作为动态演变的属性?
- RQ2将物体功能与物体-物体交互纳入模型后,对子活动与高层活动识别准确率的提升程度如何?
- RQ3对时间上下文与时间分割不确定性的建模,如何影响联合活动与功能识别的性能?
- RQ4子活动上下文、物体上下文与物体-物体交互对功能检测性能的相对贡献是什么?
- RQ5具有隐式分割的统一MRF框架是否能优于依赖固定或单一分割假设的方法?
主要发现
- 所提方法在未见受试者上的高层活动识别中,实现了81.8%的端到端精确率与80.0%的召回率,表现出强大的泛化能力。
- 物体上下文显著提升了子活动标注性能:与无物体节点的模型相比,微平均精确率提升14.1%,宏平均精确率与召回率分别提升23.3%。
- 子活动上下文改善了功能检测:与仅依赖物体的模型相比,微平均精确率提升4.9%,宏平均精确率提升17.7%,召回率提升11.1%。
- 建模物体-物体交互显著提升了功能检测:与无此类边的模型相比,宏平均召回率提升14.9%,宏平均精确率提升10.9%。
- 时间上下文至关重要:移除时间边后,功能的微平均精确率下降4.8%,子活动的微平均精确率下降10.0%,高层活动精确率下降3.3%。
- 通过融合多种分割的预测结果提升了性能:与使用最佳单一分割相比,功能的宏平均精确率提升5.8%,子活动的宏平均精确率提升9.1%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。