[论文解读] Test-Time Personalization with a Transformer for Human Pose Estimation
该论文提出了一种基于Transformer的推理时个性化(Test-Time Personalization, TTP)方法,用于2D人体姿态估计。该方法在推理阶段仅使用未标注的测试图像,通过联合训练监督与自监督关键点估计任务,并利用Transformer对齐两类关键点特征,实现对预训练模型的微调,从而在Human 3.6M、Penn Action和BBC Pose数据集上显著提升姿态估计精度。该方法无需人工标注或隐私敏感数据,具有良好的实用性与隐私保护性。
We propose to personalize a human pose estimator given a set of test images of a person without using any manual annotations. While there is a significant advancement in human pose estimation, it is still very challenging for a model to generalize to different unknown environments and unseen persons. Instead of using a fixed model for every test case, we adapt our pose estimator during test time to exploit person-specific information. We first train our model on diverse data with both a supervised and a self-supervised pose estimation objectives jointly. We use a Transformer model to build a transformation between the self-supervised keypoints and the supervised keypoints. During test time, we personalize and adapt our model by fine-tuning with the self-supervised objective. The pose is then improved by transforming the updated self-supervised keypoints. We experiment with multiple datasets and show significant improvements on pose estimations with our self-supervised personalization.
研究动机与目标
- 解决2D人体姿态估计算法在未见个体及分布外测试样本上泛化能力不足的问题,且无需人工标注。
- 仅使用单个目标人物的未标注图像,在推理阶段实现姿态估计的个性化,同时保护隐私并避免高昂的标注成本。
- 通过可学习的变换机制,提升自监督与监督关键点估计任务之间的相关性。
- 设计一种方法,在推理阶段通过微调自监督目标提升姿态估计性能,无需连续视频或模型重新训练。
提出的方法
- 模型在多样化数据上进行预训练,同时采用监督关键点估计与基于外观不变热图的自监督关键点重建任务。
- 引入Transformer以学习自监督与监督关键点热图之间的对应关系与亲和力,实现跨任务性能提升。
- 在推理阶段,仅通过目标人物的未标注图像微调自监督头,实现模型个性化。
- 将优化后的自监督关键点通过学习得到的Transformer转换为更准确的监督关键点预测结果。
- 该方法仅依赖单张图像,无需连续帧,适用于非连续视频或图像序列。
- 通过mPCK在多个数据集上评估性能,并辅以消融实验验证Transformer与TTP机制的贡献。
实验结果
研究问题
- RQ1在不依赖人工标注的前提下,利用自监督关键点估计进行推理时适应,能否提升姿态估计精度?
- RQ2基于可学习Transformer的自监督与监督关键点头之间的变换机制,如何增强个性化能力?
- RQ3在推理阶段,随着未标注测试图像帧数的增加,该方法的性能是否持续提升?
- RQ4当仅使用单张图像输入时,该方法与最先进视频模型相比表现如何?
- RQ5该方法是否与时间平滑技术(如Savitzky–Golay滤波)具有互补性?
主要发现
- 在Penn Action数据集上,该方法达到89.0 mPCK,较基线(85.2)提升3.8个百分点,且在在线与离线TTP设置下均有显著增益。
- 在BBC Pose数据集上,该方法达到93.1 mPCK(最佳情况),优于基线(88.7),并在部分设置下超越最先进视频模型。
- 随着测试帧数增加,性能持续提升,表明推理阶段可用的未标注数据越多,性能越优。
- 性能增益并非源于时间信息,因为即使在非连续帧上该方法仍有效,且可与时间平滑技术互补。
- 基于Transformer的变换机制通过微调自监督特征,直接提升了监督关键点预测性能,验证了设计选择的有效性。
- 该方法具有良好的泛化能力,在从Penn Action迁移到Human 3.6M时达到61.04 mPCK,展现出跨数据集的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。