[论文解读] View-Invariant Probabilistic Embedding for Human Pose
本文提出 Pr-VIPE,一种基于概率的视角不变姿态嵌入模型,通过学习对视角变化具有不变性的 2D 关键点表示,无需预测 3D 姿态。通过将嵌入建模为多元高斯分布,该方法捕捉了从 2D 到 3D 投影的不确定性,在跨视角姿态检索任务中达到最先进性能,并可仅使用 2D 关键点实现动作识别与视频对齐等下游应用。
Depictions of similar human body configurations can vary with changing viewpoints. Using only 2D information, we would like to enable vision algorithms to recognize similarity in human body poses across multiple views. This ability is useful for analyzing body movements and human behaviors in images and videos. In this paper, we propose an approach for learning a compact view-invariant embedding space from 2D joint keypoints alone, without explicitly predicting 3D poses. Since 2D poses are projected from 3D space, they have an inherent ambiguity, which is difficult to represent through a deterministic mapping. Hence, we use probabilistic embeddings to model this input uncertainty. Experimental results show that our embedding model achieves higher accuracy when retrieving similar poses across different camera views, in comparison with 2D-to-3D pose lifting models. We also demonstrate the effectiveness of applying our embeddings to view-invariant action recognition and video alignment. Our code is available at https://github.com/google-research/google-research/tree/master/poem.
研究动机与目标
- 学习一个紧凑且视角不变的 2D 人体姿态嵌入空间,使其在不同摄像头视角下保持一致性。
- 通过概率嵌入建模输入不确定性,解决 2D 姿态投影的固有歧义性。
- 仅使用 2D 关键点输入,无需 3D 真值或图像上下文,实现准确的姿态检索与下游视觉任务(如动作识别、视频对齐)。
- 证明仅通过 2D 关键点嵌入即可实现视角不变性,而无需显式预测 3D 姿态或进行刚性对齐后处理。
提出的方法
- 模型使用深度神经网络将 2D 关键点坐标映射到由多元高斯分布(均值与协方差)定义的概率嵌入空间。
- 通过使用难负样本挖掘的对比损失进行优化,促使来自不同视角的相似姿态在嵌入空间中彼此靠近。
- 通过透视投影从 3D 姿态合成多视角 2D 姿态对训练数据进行增强,提升对多样化视角的泛化能力。
- 模型在 Human3.6M 和 3DHP 等数据集的 2D 关键点检测结果上端到端训练,推理过程中无需图像级监督或 3D 真值。
- 概率建模使模型能够学习不确定性:嵌入中的更高方差对应于更高的 2D 姿态歧义性。
- 在下游任务中,通过嵌入空间中的马氏距离计算相似性,实现高效的检索与对齐。
实验结果
研究问题
- RQ1仅使用 2D 姿态嵌入能否在不预测 3D 姿态的情况下实现视角不变的相似性?
- RQ2如何在嵌入空间中有效建模来自 2D 到 3D 投影歧义性的输入不确定性?
- RQ3与确定性嵌入相比,概率嵌入形式是否能提升跨视角姿态检索的性能?
- RQ4所学习的嵌入能否泛化到真实场景数据,并有效支持动作识别与视频对齐?
主要发现
- Pr-VIPE 仅使用 2D 关键点检测和无真值监督,在 H3.6M 评估子集上达到 75.2% 的 Hit@1,优于完全监督的 EpipolarPose(72.7% Hit@1)。
- 尽管存在多样的主体与相机角度,模型在 3DHP 和真实场景的保留数据集上仍表现出良好的泛化能力,检索准确率高。
- 概率嵌入形式与输入歧义性相关:2D 姿态在 3D 投影中歧义性越高,其嵌入的方差也越大。
- Pr-VIPE 在 Penn Action 数据集上实现了有效的视频对齐,通过匹配姿态嵌入实现不同视角动作视频的同步,无需显式时间对齐。
- 与 2D 到 3D 提升模型相比,该模型在检索准确性上表现更优,且无需在查询与索引对之间进行刚性 3D 对齐。
- 定性结果表明,高置信度检索结果在大视角变化和部分遮挡下仍具视觉准确性,验证了模型的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。