Skip to main content
QUICK REVIEW

[论文解读] Concurrence-Aware Long Short-Term Sub-Memories for Person-Person Action Recognition

Xiangbo Shu|arXiv (Cornell University)|Jun 3, 2017
Human Pose and Action Recognition参考文献 38被引用 10
一句话总结

本文提出了一种基于LSTM的新架构——并发感知长短期记忆子记忆模块(Co-LSTSM),通过两个子记忆单元和一个协同记忆单元,联合处理两个人的运动特征,以建模其长期相互关联的动力学行为。该方法在人物-人物动作识别任务上达到最先进性能,在BIT数据集上相比先前基于LSTM的方法提升约8%,在UT数据集上达到95.00%的准确率。

ABSTRACT

Recently, Long Short-Term Memory (LSTM) has become a popular choice to model individual dynamics for single-person action recognition due to its ability of modeling the temporal information in various ranges of dynamic contexts. However, existing RNN models only focus on capturing the temporal dynamics of the person-person interactions by naively combining the activity dynamics of individuals or modeling them as a whole. This neglects the inter-related dynamics of how person-person interactions change over time. To this end, we propose a novel Concurrence-Aware Long Short-Term Sub-Memories (Co-LSTSM) to model the long-term inter-related dynamics between two interacting people on the bounding boxes covering people. Specifically, for each frame, two sub-memory units store individual motion information, while a concurrent LSTM unit selectively integrates and stores inter-related motion information between interacting people from these two sub-memory units via a new co-memory cell. Experimental results on the BIT and UT datasets show the superiority of Co-LSTSM compared with the state-of-the-art methods.

研究动机与目标

  • 解决现有RNN和LSTM模型在人物-人物动作识别中难以捕捉两人长期相互关联动力学的局限性。
  • 建模并发的相互关联运动模式(如对称或相互作用的运动),而非将个体独立处理或视为单一整体。
  • 通过新型并发LSTM单元与协同记忆单元,显式学习时间依赖性,提升交互运动模式的识别准确率。
  • 在动作识别与早期互动预测任务中,验证所提出架构的有效性。

提出的方法

  • 该模型在每帧视频中采用具有两个子记忆单元的并发LSTM单元,用于存储来自互动人物边界框的个体运动表征。
  • 提出一种新型协同记忆单元πₜ,选择性地整合并存储来自两个子记忆单元的相互关联运动信息,捕捉个体间的并发动力学。
  • 并发LSTM单元输出反映相互关联运动动力学的联合隐藏表征,而非个体运动特征。
  • 通过堆叠并发LSTM单元,递归建模随时间在连续视频帧间相互关联动力学的演化。
  • 采用标准反向传播进行端到端训练,协同记忆单元实现对相关人际运动模式的选择性关注。
  • 在BIT和UT数据集上,对动作识别与早期互动预测任务进行评估。

实验结果

研究问题

  • RQ1经修改的LSTM架构是否能有效建模人物-人物动作识别中两人之间的长期相互关联运动动力学?
  • RQ2与标准LSTM或独立建模个体的方法相比,引入选择性整合相互关联运动特征的协同记忆单元,在识别性能上提升程度如何?
  • RQ3在时间上下文有限的情况下,所提出的Co-LSTSM模型在多大程度上能更早预测正在进行的互动?
  • RQ4该模型在包括对称互动(如握手)和非对称互动(如踢击与后退)等多种互动类型上是否具有良好泛化能力?

主要发现

  • 在BIT数据集上,Co-LSTSM达到95.00%的识别准确率,比之前最先进方法高出约8个百分点。
  • 在UT数据集上,Co-LSTSM达到95.00%的准确率,与最佳性能方法(Zhang et al. [56])持平,并超越所有基于LSTM的基线方法。
  • 在人类互动预测任务中,Co-LSTSM在观察比例为0.6时取得最显著的性能提升,表明其具备强大的早期预测能力。
  • 模型准确率在观察比例0.4至0.6之间迅速上升,表明其在互动执行中段已捕捉到关键动力学特征。
  • 在观察比例达到0.7时,模型性能趋于稳定,表明此时已充分捕获相互关联的运动模式,可实现可靠预测。
  • 在所有观察比例下,Co-LSTSM在互动预测任务中均显著优于所有对比方法,包括DBoW、SC、MSSC、MTSSVM、MMAPM、LRCN和SSTFL。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。