[论文解读] Inference Stage Optimization for Cross-scenario 3D Human Pose Estimation
本文提出推理阶段优化(ISO),一种新颖的框架,通过在推理阶段对未标记的目标数据执行几何感知自监督学习(SSL),提升3D人体姿态估计在跨场景设置下的泛化能力。通过利用随机投影对抗样本和几何循环一致性,ISO在预测前对每个样本实例进行自适应调整,实现了在MPI-INF-3DHP数据集上83.6%的3D PCK新SOTA结果,相比之前方法提升9.7%。
Existing 3D human pose estimation models suffer performance drop when applying to new scenarios with unseen poses due to their limited generalizability. In this work, we propose a novel framework, Inference Stage Optimization (ISO), for improving the generalizability of 3D pose models when source and target data come from different pose distributions. Our main insight is that the target data, even though not labeled, carry valuable priors about their underlying distribution. To exploit such information, the proposed ISO performs geometry-aware self-supervised learning (SSL) on each single target instance and updates the 3D pose model before making prediction. In this way, the model can mine distributional knowledge about the target scenario and quickly adapt to it with enhanced generalization performance. In addition, to handle sequential target data, we propose an online mode for implementing our ISO framework via streaming the SSL, which substantially enhances its effectiveness. We systematically analyze why and how our ISO framework works on diverse benchmarks under cross-scenario setup. Remarkably, it yields new state-of-the-art of 83.6% 3D PCK on MPI-INF-3DHP, improving upon the previous best result by 9.7%. Code will be released.
研究动机与目标
- 解决3D姿态估计模型在面对未见姿态分布的新场景时性能下降的问题。
- 在目标域无需标注数据的前提下提升模型泛化能力。
- 开发一种利用未标记目标实例先验在推理阶段适应模型的方法。
- 通过框架的在线变体实现实序列数据的有效适应。
- 提供基于实证与消融分析的理解,阐明推理阶段适应为何以及如何提升跨场景性能。
提出的方法
- ISO框架在推理阶段对每个未标记目标样本执行自监督学习(SSL),以优化模型的预测结果。
- 采用两种几何感知的SSL技术:随机投影对抗样本和几何循环一致性,以学习鲁棒的3D姿态表征。
- 模型通过端到端联合训练,结合完全监督学习(FSL)与SSL,以提升泛化能力并实现高效的推理阶段自适应。
- 在线ISO变体通过流式处理方式在连续目标样本间传播SSL更新,实现实时自适应,同时显著降低计算开销。
- 框架通过反向传播对每个目标实例进行迭代优化,基于几何先验条件逐步精炼3D姿态估计结果。
- 轻量化推理模式(Online-skip)仅每10个样本执行一次SSL,实现接近实时的推理效率,且性能损失极小。
实验结果
研究问题
- RQ1在未标记目标数据上进行自监督学习是否能提升3D姿态估计在跨场景设置下的泛化能力?
- RQ2如随机投影对抗样本和几何循环一致性等几何感知SSL组件,如何增强推理阶段的自适应能力?
- RQ3在线自适应对序列数据的影响如何?与批处理推理相比有何差异?
- RQ4在2D姿态输入存在噪声的情况下,ISO表现如何?是否优于基线模型?
- RQ5为何ISO在头、手腕和脚踝等特定身体部位在复杂场景下表现更优?
主要发现
- ISO在MPI-INF-3DHP基准上实现了83.6%的3D PCK新SOTA结果,相比之前最佳结果提升9.7%。
- 在线ISO变体在每样本仅需0.027秒的情况下实现83.6%的3D PCK,支持高效实时推理。
- Online-skip变体将每样本推理时间缩短至0.004秒——几乎与标准推理持平——同时保持83.0%的3D PCK。
- ISO在头、手腕和脚踝等难以估计的身体部位表现显著提升,表明对分布偏移具有强鲁棒性。
- 即使在极端高斯噪声(σ=10)下,ISO仍保持79.6%的3D PCK,优于基线模型(78.9%),且使用真实2D姿态输入。
- 分布对齐分析表明,ISO成功将预测的3D姿态分布对齐至目标集的真实分布。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。