[论文解读] 3D Human Pose, Shape and Texture from Low-Resolution Images and Videos
本文提出RSC-Net,一种分辨率感知的深度神经网络,通过自监督和对比学习,从低分辨率图像和视频中估计3D人体姿态、形状和纹理。该方法仅用一个模型即可在多种分辨率下实现最先进性能,克服了超分辨率和特定分辨率训练的局限性。
3D human pose and shape estimation from monocular images has been an active research area in computer vision. Existing deep learning methods for this task rely on high-resolution input, which however, is not always available in many scenarios such as video surveillance and sports broadcasting. Two common approaches to deal with low-resolution images are applying super-resolution techniques to the input, which may result in unpleasant artifacts, or simply training one model for each resolution, which is impractical in many realistic applications. To address the above issues, this paper proposes a novel algorithm called RSC-Net, which consists of a Resolution-aware network, a Self-supervision loss, and a Contrastive learning scheme. The proposed method is able to learn 3D body pose and shape across different resolutions with one single model. The self-supervision loss enforces scale-consistency of the output, and the contrastive learning scheme enforces scale-consistency of the deep features. We show that both these new losses provide robustness when learning in a weakly-supervised manner. Moreover, we extend the RSC-Net to handle low-resolution videos and apply it to reconstruct textured 3D pedestrians from low-resolution input. Extensive experiments demonstrate that the RSC-Net can achieve consistently better results than the state-of-the-art methods for challenging low-resolution images.
研究动机与目标
- 解决从常见于监控和体育视频中的低分辨率图像中进行3D人体姿态与形状估计的挑战。
- 克服现有方法依赖高分辨率输入或超分辨率技术所引入的伪影和域差距问题。
- 开发一个统一的深度学习模型,无需微调或分辨率特定的适应,即可在任意图像分辨率下泛化。
- 通过引入自监督和对比学习策略,缓解因3D标注稀疏导致的弱监督问题。
- 将方法扩展至从低分辨率视频输入中重建带纹理的3D行人。
提出的方法
- 提出RSC-Net,一种具有共享特征提取器和分辨率相关参数的分辨率感知网络,可自适应地融合不同分辨率下的特征。
- 引入方向性自监督损失,通过利用更高分辨率输出作为指导,强制同一图像在不同分辨率下的预测保持尺度一致性。
- 采用对比学习方案,通过最大化特征间互信息的对比损失,强制不同分辨率下深层特征表示的一致性。
- 在自监督损失中采用分层监督策略,其中高分辨率预测作为低分辨率预测的软目标。
- 在纹理估计网络中采用编码器-解码器架构,结合全局上下文模块和上采样层,以提升UV图质量。
- 采用从高分辨率到低分辨率的渐进式训练策略,以稳定优化并提升收敛性。
实验结果
研究问题
- RQ1一个单一的深度神经网络能否在无需分辨率特定微调的情况下,有效估计广泛范围内的低分辨率图像中的3D人体姿态与形状?
- RQ2当3D标注稀疏或不可用时,如何利用自监督来提升3D估计性能?
- RQ3与均方误差损失相比,对比学习能否更有效地提升跨分辨率的特征表示一致性?
- RQ4渐进式训练在多分辨率低分辨率输入上的模型稳定性和性能提升方面,其作用有多大?
- RQ5所提出的方法能否泛化至视频输入,并从低分辨率序列中生成高质量的带纹理3D行人?
主要发现
- RSC-Net在低分辨率3D人体姿态与形状估计任务上达到最先进性能,在多个基准测试中超越了现有SOTA方法。
- 消融实验证实,分辨率感知网络、自监督和对比学习所有组件均对性能提升有显著贡献。
- 方向性自监督损失通过利用高分辨率预测的置信度,优于原始对称自监督损失,有效减少了高分辨率输出的退化。
- 对比特征损失相比MSE能生成更优的特征表示,表现为跨分辨率一致性与3D估计准确性的提升。
- 结合全局上下文与上采样层的纹理估计网络生成了更高品质的UV图,其中逐点求和融合方法优于拼接方法。
- 该方法在视频输入上表现出良好的泛化能力,可实现从低分辨率视频序列中高质量的带纹理3D行人重建。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。