Skip to main content
QUICK REVIEW

[论文解读] Who did What at Where and When: Simultaneous Multi-Person Tracking and Activity Recognition

Wenbo Li, Ming‐Ching Chang|arXiv (Cornell University)|Jul 3, 2018
Human Pose and Action Recognition参考文献 23被引用 9
一句话总结

该论文提出了一种自举框架,通过基于超图的建模方法联合优化多人跟踪与活动识别,以捕捉个体之间、成对互动以及集体活动的高阶相关性。通过在多阶段贝叶斯框架中整合活动感知跟踪、基于互动识别的遮挡恢复以及集体活动推理,该方法在跟踪(MOTA 最高达 85.3%)和活动识别(准确率约 90%)方面均实现了最先进性能,具备对严重遮挡的鲁棒性,并支持实时处理(约 20 FPS)。

ABSTRACT

We present a bootstrapping framework to simultaneously improve multi-person tracking and activity recognition at individual, interaction and social group activity levels. The inference consists of identifying trajectories of all pedestrian actors, individual activities, pairwise interactions, and collective activities, given the observed pedestrian detections. Our method uses a graphical model to represent and solve the joint tracking and recognition problems via multi-stages: (1) activity-aware tracking, (2) joint interaction recognition and occlusion recovery, and (3) collective activity recognition. We solve the where and when problem with visual tracking, as well as the who and what problem with recognition. High-order correlations among the visible and occluded individuals, pairwise interactions, groups, and activities are then solved using a hypergraph formulation within the Bayesian framework. Experiments on several benchmarks show the advantages of our approach over state-of-art methods.

研究动机与目标

  • 解决现有检测后跟踪方法在建模复杂社交动态与群体互动方面的局限性。
  • 通过联合优化跟踪与识别,同时解决多人活动识别中的“谁”、“什么”、“哪里”和“何时”问题。
  • 通过利用已识别活动与互动中的高阶相关性,提升遮挡情况下的跟踪鲁棒性。
  • 开发一种可泛化、实时的框架,无需相机标定,支持在线视频处理。
  • 通过建模成对互动与一致群体行为的结构依赖关系,实现对集体活动(如群体过街)的准确识别。

提出的方法

  • 使用具有三个推理阶段的动态图模型来表述联合跟踪与识别问题:活动感知跟踪、联合互动识别与遮挡恢复、集体活动识别。
  • 在贝叶斯框架内,采用超图公式建模可见与遮挡个体、成对互动以及群体活动之间的高阶相关性。
  • 使用两个独立的超图:$\mathcal{H}_{\mathcal{T}}$ 用于建模个体活动之间的相关性以改善轨迹片段关联,$\mathcal{H}_{\mathcal{R}}$ 用于建模基于互动的相关性以实现遮挡恢复。
  • 在超图中应用凝聚簇搜索,以高效求解优化问题并推断一致的轨迹与活动标签。
  • 引入体姿方向检测等辅助输入,以提升识别与跟踪的准确性。
  • 实施一种自举机制,将改进的跟踪与识别结果迭代地用作先验,以相互优化。

实验结果

研究问题

  • RQ1能否有效建模个体活动、成对互动与集体群体行为之间的高阶相关性,从而同时提升跟踪与识别性能?
  • RQ2联合优化跟踪与活动识别在处理遮挡与模糊动作方面,为何优于顺序或独立的方法?
  • RQ3与普通图模型相比,超图公式在捕捉复杂社交动态并提升识别与跟踪性能方面,优势有多大?
  • RQ4所提出的框架是否能在无需相机标定或离线处理的情况下实现实时性能?
  • RQ5$\mathcal{H}_{\mathcal{T}}$ 与 $\mathcal{H}_{\mathcal{R}}$ 超图在提升跟踪鲁棒性与识别准确率方面的贡献有何不同?

主要发现

  • 所提方法在个体活动识别上达到约 90% 的准确率,显著优于现有最先进方法在集体活动识别上的表现。
  • 在 CAD 数据集上,该方法取得了最高的 MOTA 得分(85.3%),并在关键跟踪指标(如碎片化程度 FM、身份切换数 IDs、召回率 Rcll)上全面超越所有基线方法。
  • 使用 $\mathcal{H}_{\mathcal{R}}$ 超图进行互动建模对性能提升的贡献大于 $\mathcal{H}_{\mathcal{T}}$,尤其是在遮挡恢复方面。
  • 将超图替换为普通图会导致跟踪与识别性能明显下降,验证了高阶相关性建模的必要性。
  • 在严重遮挡情况下,该方法产生的身份切换最少,如图 7 的跟踪结果对比所直观证实,表现出卓越的鲁棒性。
  • 该框架在真实场景中运行速度约为 20 FPS,适用于在线视频监控与态势感知应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。