[论文解读] Multi-person Articulated Tracking with Spatial and Temporal Embeddings
该论文提出了一种统一的、端到端可训练的多人刚性姿态跟踪框架,采用SpatialNet进行空间关键点分组,TemporalNet进行时间轨迹关联。通过引入关键点嵌入(KE)、空间实例嵌入(SIE)、人体嵌入(HE)和时间实例嵌入(TIE),并结合可微分的姿态引导分组(PGG)模块,该方法实现了最先进性能,在PoseTrack上的MOTA从65.4%提升至71.8%。
We propose a unified framework for multi-person pose estimation and tracking. Our framework consists of two main components,~\ie~SpatialNet and TemporalNet. The SpatialNet accomplishes body part detection and part-level data association in a single frame, while the TemporalNet groups human instances in consecutive frames into trajectories. Specifically, besides body part detection heatmaps, SpatialNet also predicts the Keypoint Embedding (KE) and Spatial Instance Embedding (SIE) for body part association. We model the grouping procedure into a differentiable Pose-Guided Grouping (PGG) module to make the whole part detection and grouping pipeline fully end-to-end trainable. TemporalNet extends spatial grouping of keypoints to temporal grouping of human instances. Given human proposals from two consecutive frames, TemporalNet exploits both appearance features encoded in Human Embedding (HE) and temporally consistent geometric features embodied in Temporal Instance Embedding (TIE) for robust tracking. Extensive experiments demonstrate the effectiveness of our proposed model. Remarkably, we demonstrate substantial improvements over the state-of-the-art pose tracking method from 65.4\% to 71.8\% Multi-Object Tracking Accuracy (MOTA) on the ICCV'17 PoseTrack Dataset.
研究动机与目标
- 解决在遮挡、运动和相机变化等复杂视频中多人刚性姿态跟踪的挑战。
- 克服现有方法依赖后处理或与任务无关的相似性度量(如OKS和IoU)的局限性。
- 通过将分组模块整合进学习流程,实现姿态估计与跟踪的端到端训练。
- 通过在时间维度上结合外观特征(HE)与几何特征(TIE),以及在帧内结合关键点特征(KE)与空间特征(SIE),提升鲁棒性。
- 开发一种可微分的姿态引导分组模块,以实现跟踪误差向低层特征学习的反向传播。
提出的方法
- SpatialNet通过关键点嵌入(KE)与空间实例嵌入(SIE)在单帧内完成人体部位检测与部件级分组,并引入辅助的序关系预测以提升可解释性与收敛性。
- 姿态引导分组(PGG)模块使整个检测与分组流程可微分且端到端可训练,支持从跟踪损失到特征提取阶段的梯度流动。
- TemporalNet通过人体嵌入(HE)获取整体外观特征,通过时间实例嵌入(TIE)实现帧间一致性,将空间分组扩展至时间维度的跟踪。
- HE与TIE联合优化,以在应对姿态变化(TIE)与相机运动(HE)时保持平衡,从而在复杂条件下实现更可靠的跟踪。
- 该框架将空间与时间嵌入统一整合于同一架构中,并共享主干网络以实现高效的特征学习。
- 采用多任务学习策略,联合优化关键点检测、嵌入预测与序关系监督,以提升泛化能力与训练稳定性。
实验结果
研究问题
- RQ1统一的、端到端可微分框架是否能通过整合空间与时间嵌入,提升多人姿态跟踪性能?
- RQ2在时间域中联合使用外观特征(HE)与几何特征(TIE)相比单独使用度量指标,能否显著增强对姿态变化与相机运动的鲁棒性?
- RQ3引入可微分分组模块(PGG)相比非可微分后处理,在部件级与实例级关联的准确性上能提升多少?
- RQ4通过辅助序关系预测引入的几何排序约束,是否能提升空间分组中关键点嵌入(KE)与空间实例嵌入(SIE)的可解释性与性能?
- RQ5在具有挑战性的视频条件下,该方法与基于与任务无关度量(如OKS与IoU)的SOTA跟踪基线相比,在MOTA与AP指标上的表现如何?
主要发现
- 所提方法在ICCV’17 PoseTrack数据集上实现了71.8%的新SOTA MOTA,较此前SOTA的65.4%有显著提升。
- 在MS-COCO数据集上,该模型在单帧姿态估计中达到77.0 AP,无需模型集成或后处理优化,较之前方法在多尺度推理下高出3% AP。
- 消融实验表明,结合KE与SIE、辅助序关系预测及PGG模块可获得最佳性能,在MS-COCO上达到77.0 AP,在PoseTrack上达到71.8% MOTA。
- 姿态引导分组(PGG)模块显著提升了嵌入的紧凑性与准确性,可视化结果表明,经PGG处理后,同一人物像素的嵌入值更加一致。
- 结合HE与TIE的TemporalNet展现出优越的跟踪鲁棒性:HE可应对相机缩放与移动,TIE则在大姿态变化与遮挡下保持一致性。
- 运行时分析显示,该方法保持了高效率:SpatialNet在保持低计算成本的同时,精度优于主流自顶向下基线;TemporalNet相较基于图割的追踪器更具效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。