[论文解读] Aligning Silhouette Topology for Self-Adaptive 3D Human Pose Recovery
该论文提出了一种用于3D人体姿态恢复的自监督域自适应框架,仅使用前景轮廓图将源域预训练模型适配到各种未标注的目标域。通过使用卷积友好的空间变换从轮廓图中解耦出拓扑骨架,并利用距离场实现基于Chamfer的拓扑对齐损失,该方法在低分辨率、对抗性扰动以及真实世界等具有挑战性的域上实现了最先进性能,且无需依赖2D/3D姿态或多视角监督。
Articulation-centric 2D/3D pose supervision forms the core training objective in most existing 3D human pose estimation techniques. Except for synthetic source environments, acquiring such rich supervision for each real target domain at deployment is highly inconvenient. However, we realize that standard foreground silhouette estimation techniques (on static camera feeds) remain unaffected by domain-shifts. Motivated by this, we propose a novel target adaptation framework that relies only on silhouette supervision to adapt a source-trained model-based regressor. However, in the absence of any auxiliary cue (multi-view, depth, or 2D pose), an isolated silhouette loss fails to provide a reliable pose-specific gradient and requires to be employed in tandem with a topology-centric loss. To this end, we develop a series of convolution-friendly spatial transformations in order to disentangle a topological-skeleton representation from the raw silhouette. Such a design paves the way to devise a Chamfer-inspired spatial topological-alignment loss via distance field computation, while effectively avoiding any gradient hindering spatial-to-pointset mapping. Experimental results demonstrate our superiority against prior-arts in self-adapting a source trained model to diverse unlabeled target domains, such as a) in-the-wild datasets, b) low-resolution image domains, and c) adversarially perturbed image domains (via UAP).
研究动机与目标
- 解决由于训练数据中的域偏差导致的3D人体姿态估计在域偏移下的泛化能力差的问题。
- 实现在新型、未标注的目标环境中部署3D姿态模型,其中强监督信号(如2D/3D姿态)不可用。
- 利用前景轮廓估计的鲁棒性——不受光照、分辨率或对抗性扰动等域偏移影响——作为唯一监督信号。
- 设计一种以拓扑为中心的损失,从轮廓图中提供强而具有姿态特异性的监督,克服像素级损失的局限性。
- 在无需目标域中2D/3D姿态标注、深度信息或多视角数据的情况下,实现最先进水平的域自适应性能。
提出的方法
- 设计一系列卷积友好的空间变换,从原始二值轮廓图中提取拓扑骨架表征。
- 使用可微分的空间操作从轮廓图构建距离场,以在优化过程中实现梯度流动。
- 提出一种基于Chamfer的、空间上的拓扑对齐损失,通过最小化距离场来度量预测与真实拓扑骨架之间的对应关系。
- 通过消除空间到点集的映射,避免梯度退化,确保通过拓扑表征的稳定反向传播。
- 将拓扑对齐损失与标准网格拟合目标相结合,在自适应过程中联合优化形状与姿态。
- 仅使用目标域的轮廓图端到端训练模型,实现在推理时无需额外监督的自适应。
实验结果
研究问题
- RQ1自监督域自适应框架是否能在仅使用轮廓监督的多样化、未标注目标域中实现强大的3D人体姿态恢复性能?
- RQ2如何有效从二值轮廓图中提取拓扑结构,以在像素级损失失效时提供姿态特异性监督?
- RQ3在缺乏2D/3D姿态监督的情况下,基于可微分距离场的拓扑对齐损失是否能超越标准的像素级损失或形状中心损失?
- RQ4基于轮廓的自适应在多大程度上能缓解由低分辨率、对抗性扰动或真实世界条件等域偏移引起的表现退化?
- RQ5当辅助监督(如OpenPose预测的2D姿态)因域偏移而失效时,所提出的拓扑感知损失是否仍能实现鲁棒的自适应?
主要发现
- 所提方法在真实世界3DPW数据集和低分辨率LR-3DPW域上均达到最先进性能,优于使用2D姿态监督的基线方法。
- 在对抗性扰动的UAP-H3M域上,该方法显著优于依赖OpenPose预测2D姿态的基线方法,后者因域偏移而失效。
- 即使目标轮廓图分辨率较低,该框架仍能实现有效自适应,表明对图像质量退化具有鲁棒性。
- 定性结果表明,模型仅通过轮廓图即可拟合3D网格,实现在热成像或NIR图像等未见域上的快速推理时自适应。
- 消融研究证实,拓扑感知损失至关重要——仅使用像素级损失无法为姿态恢复提供可靠的梯度。
- 该方法在关节运动等域偏移下成功缓解了分布偏移的影响,凸显了拓扑监督相比关键点监督在分布偏移中的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。