Skip to main content
QUICK REVIEW

[论文解读] Structure Inference Machines: Recurrent Neural Networks for Analyzing Relations in Group Activity Recognition

Zhiwei Deng, Arash Vahdat|arXiv (Cornell University)|Nov 13, 2015
Human Pose and Action Recognition被引用 13
一句话总结

本文提出结构推理机器(SIMs),一种将深度学习与结构化推理相结合的循环神经网络框架,用于群体活动识别。通过使用可学习门控机制动态确定场景中个体之间的关系,SIMs 迭代优化动作预测并提升场景级分类性能,在 Collective Activity 数据集上达到 81.2% 的最先进准确率,并在个体层面动作识别上实现最高 10% 的性能提升。

ABSTRACT

Rich semantic relations are important in a variety of visual recognition problems. As a concrete example, group activity recognition involves the interactions and relative spatial relations of a set of people in a scene. State of the art recognition methods center on deep learning approaches for training highly effective, complex classifiers for interpreting images. However, bridging the relatively low-level concepts output by these methods to interpret higher-level compositional scenes remains a challenge. Graphical models are a standard tool for this task. In this paper, we propose a method to integrate graphical models and deep neural networks into a joint framework. Instead of using a traditional inference method, we use a sequential inference modeled by a recurrent neural network. Beyond this, the appropriate structure for inference can be learned by imposing gates on edges between nodes. Empirical results on group activity recognition demonstrate the potential of this model to handle highly structured learning tasks.

研究动机与目标

  • 解决在群体活动识别中超越平面分类的复杂、组合性视觉关系建模挑战。
  • 通过在实体上进行结构化推理,弥合底层深度网络输出与高层场景理解之间的鸿沟。
  • 通过在消息传递过程中学习自适应、动态结构,克服固定图模型与传统推理方法的局限性。
  • 开发一个端到端可训练的框架,通过门控机制联合优化节点分类、消息传递与结构连接。
  • 在具有复杂、可变群体交互关系的真实世界数据集上,验证该方法的有效性。

提出的方法

  • 使用循环神经网络(RNN)对卷积神经网络(CNN)的输出进行迭代推理,通过消息传递逐步优化节点预测。
  • 在节点之间的边引入可学习门控函数,以确定哪些连接是相关的,从而在推理过程中实现动态结构学习。
  • 采用门控消息传递机制,使用共享或非共享权重,其中门控值通过可微函数计算,以控制信息流动。
  • 使用反向传播对整个模型进行端到端训练,实现 CNN 特征、消息传递与结构门控的联合优化。
  • 将推理过程形式化为一系列步骤,每次迭代均基于相邻节点的上下文信息优化节点预测。
  • 采用可微的推理近似方法,以支持基于梯度的学习,同时优化消息权重与结构连接。

实验结果

研究问题

  • RQ1循环神经网络能否有效用于深度神经网络输出的结构化推理,以支持视觉推理任务?
  • RQ2可学习门控在建模群体活动识别中个体间动态、任务特定关系方面,能带来多大程度的改进?
  • RQ3与传统的 CRF 或 SVM 方法相比,端到端训练的联合深度学习与图模型框架在准确率与泛化能力方面表现如何?
  • RQ4学习图模型结构(即哪些节点相连)是否能带来显著的性能提升,相比固定结构或全连接结构?
  • RQ5该方法在具有不同复杂度与噪声水平的群体交互关系的多样化数据集上,其鲁棒性如何?

主要发现

  • 所提模型在 Collective Activity 数据集上达到 81.2% 的准确率,优于当前最先进方法,如 Deep Struct. Model(80.6%)与 Unified Tracking And Recognition(80.6%)。
  • 在 Collective Activity Extended 数据集上,经过两次门控消息传递迭代后,个体层面动作分类准确率提升约 10%,达到 90.14%。
  • 在原始 Collective Activity 数据集上,经过三次消息传递迭代且采用门控连接后,个体层面动作分类准确率提升 6%。
  • 使用门控权重带来显著性能增益:门控非共享权重下准确率为 81.22%,而非共享权重无门控时仅为 74.33%。
  • 在 Nursing Home 数据集上,经过两次迭代后,个体层面动作准确率提升 4%,表明即使在关系更简单、更可预测的场景中,性能提升也具有一致性。
  • 可视化结果证实,模型学习到了有意义的非均匀连接——有效过滤掉噪声或无关关系,同时保留了如执行相同动作的个体之间的关键互动。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。