[论文解读] MixSTE: Seq2seq Mixed Spatio-Temporal Encoder for 3D Human Pose Estimation in Video
MixSTE 提出了一种新颖的基于序列到序列(seq2seq)的 Transformer 架构,用于三维人体姿态估计。该方法通过关节分离策略,分别建模每个关节的时序运动,并在空间和时序 Transformer 块之间交替设计,以增强时空一致性。该方法实现了最先进性能,在基准数据集上相比之前的方法,将 MPJPE 降低了 7.6%,P-MPJPE 降低了 10.9%。
Recent transformer-based solutions have been introduced to estimate 3D human pose from 2D keypoint sequence by considering body joints among all frames globally to learn spatio-temporal correlation. We observe that the motions of different joints differ significantly. However, the previous methods cannot efficiently model the solid inter-frame correspondence of each joint, leading to insufficient learning of spatial-temporal correlation. We propose MixSTE (Mixed Spatio-Temporal Encoder), which has a temporal transformer block to separately model the temporal motion of each joint and a spatial transformer block to learn inter-joint spatial correlation. These two blocks are utilized alternately to obtain better spatio-temporal feature encoding. In addition, the network output is extended from the central frame to entire frames of the input video, thereby improving the coherence between the input and output sequences. Extensive experiments are conducted on three benchmarks (Human3.6M, MPI-INF-3DHP, and HumanEva). The results show that our model outperforms the state-of-the-art approach by 10.9% P-MPJPE and 7.6% MPJPE. The code is available at https://github.com/JinluZhang1126/MixSTE.
研究动机与目标
- 为解决现有方法在建模各身体关节在帧间不同运动轨迹方面的局限性。
- 通过将输出从单个中心帧扩展到完整输入序列,提升三维姿态估计的序列一致性。
- 通过采用序列到序列学习范式,而非对重叠序列重复推理,提升推理效率并减少冗余。
- 在保持长序列中高精度和时序平滑性的同时,支持灵活的输入序列长度。
- 提供一种新型、高效且准确的三维人体姿态估计基线,采用混合时空 Transformer 编码器。
提出的方法
- 该模型采用关节分离策略,将每个 2D 关键点视为独立的 token,从而实现每个关节的时序运动学习,并降低时域上的特征维度。
- 通过在空间和时序 Transformer 块之间交替设计,逐步构建全局时空表征。
- 混合时空编码器(MixSTE)通过堆叠的 Transformer 层,整合关节之间的空间相关性与单个关节的时序动态。
- 网络采用多损失目标进行训练:加权 MPJPE 损失以提升精度,时序一致性损失(TCLoss),以及 MPJVE 损失以增强平滑性。
- 该架构支持任意长度的输入序列,并输出完整的三维姿态序列,从而提升时序一致性并减少冗余计算。
- 该方法端到端可训练,利用自注意力机制建模帧与关节之间的长距离依赖关系。
实验结果
研究问题
- RQ1建模单个关节的运动轨迹是否能提升长视频序列中三维姿态估计的精度?
- RQ2与 seq2frame 方法相比,序列到序列 Transformer 架构在精度、平滑性和推理效率方面表现如何?
- RQ3在三维姿态估计中,交替使用空间和时序注意力模块在多大程度上能增强时空特征学习?
- RQ4在三维姿态序列预测中,哪种损失函数最能有效平衡精度与时序平滑性?
- RQ5混合时空 Transformer 编码器在不造成性能下降的前提下,能否在多种不同长度的输入序列上实现良好泛化?
主要发现
- 在 Human3.6M 数据集的 Protocol 1 下,MixSTE 实现了 40.9 mm 的 MPJPE,相比之前最先进方法提升了 7.6%。
- 与先前 SOTA 方法相比,该模型将 P-MPJPE 降低了 10.9%,表明在长序列上具有更优的精度。
- 在 243 帧的输入序列下,MixSTE 实现了 40.9 mm 的 MPJPE 和 2.3 mm 的 MPJVE,表明具备出色的时序平滑性。
- 消融实验表明,结合 WMPJPE 损失、TCLoss 和 MPJVE 损失可获得最佳性能,其中 MPJVE 降低了 2.3 mm。
- 该模型保持了高效率,由于输出完整序列并减少冗余,其推理速度优于 seq2frame 基线。
- 超参数消融实验表明,深度为 8、模型维度为 512、输入长度为 243 时,性能最优,且参数增长最小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。