[论文解读] DensePose: Dense Human Pose Estimation In The Wild
本文提出DensePose-RCNN,一种深度学习框架,可在非受限、真实世界场景中建立RGB图像与参数化人体体模型之间的密集、部位特定的2D到3D对应关系。通过利用一种新颖的标注流程创建包含50,000张图像的DensePose-COCO数据集,并结合基于区域的特征学习、缺失监督的修复以及级联优化,该方法在保持最先进精度的同时实现了实时性能(20–26 FPS),接近理想评估环境下性能上限。
In this work, we establish dense correspondences between RGB image and a surface-based representation of the human body, a task we refer to as dense human pose estimation. We first gather dense correspondences for 50K persons appearing in the COCO dataset by introducing an efficient annotation pipeline. We then use our dataset to train CNN-based systems that deliver dense correspondence 'in the wild', namely in the presence of background, occlusions and scale variations. We improve our training set's effectiveness by training an 'inpainting' network that can fill in missing groundtruth values and report clear improvements with respect to the best results that would be achievable in the past. We experiment with fully-convolutional networks and region-based models and observe a superiority of the latter; we further improve accuracy through cascading, obtaining a system that delivers highly0accurate results in real time. Supplementary materials and videos are provided on the project page http://densepose.org
研究动机与目标
- 在非受限、真实世界场景中,建立2D RGB图像与人体3D表面表示之间的密集、部位特定的对应关系。
- 解决在密集人体姿态估计中因遮挡、尺度变化和背景杂乱带来的挑战。
- 开发一种可扩展、高效的标注流程,用于创建大规模图像到表面对应关系数据集。
- 训练一种深度学习模型,使其在复杂真实图像中具备强泛化能力,同时保持高精度和实时推理速度。
提出的方法
- 标注人员将人体划分为语义部位,并利用渲染的部位图像将采样的3D表面点映射到对应的图像像素,从而实现密集的2D到3D对应关系标注。
- 采用基于区域的Faster R-CNN风格主干网络(DensePose-RCNN),而非全卷积网络,以提升对尺度和姿态变化的鲁棒性。
- 训练一个修复网络以预测缺失的真实UV坐标,增强监督的有效性并改善泛化能力。
- 采用级联优化模块,利用早期阶段的特征迭代优化预测的UV坐标,显著提升精度。
- 通过联合训练实例分割头和关键点检测头,实现多任务学习,提供辅助监督以改善密集对应关系预测。
- 最终模型在DensePose-COCO数据集上进行训练,并在标准GPU硬件上实现实时推理速度。
实验结果
研究问题
- RQ1深度学习模型是否能在存在遮挡和尺度变化的非受限、真实世界图像中,实现对人体的准确密集2D到3D对应关系?
- RQ2与全卷积网络相比,基于区域的特征学习在野外密集人体姿态估计中的有效性如何?
- RQ3在标注稀疏的情况下,修复缺失的监督信号在多大程度上能提升模型的泛化能力和性能?
- RQ4级联优化和多任务学习是否能在不牺牲推理速度的前提下显著提升精度?
- RQ5完全监督、端到端的深度学习系统在密集人体对应关系估计中,能多接近性能上限?
主要发现
- 通过多任务学习和级联优化,DensePose-RCNN在COCO验证集上达到55.8% AP,显著优于先前方法。
- 结合关键点监督的级联模型达到55.8% AP,已非常接近理想评估条件下实现的性能上限57.1% AP。
- 基于区域的处理(RCNN)在尺度和姿态变化下表现远优于全卷积网络,优势显著。
- 修复监督信号带来了显著的性能提升,证明了在数据稀缺场景下增强监督的价值。
- 在GTX 1080 GPU上,系统在240×320图像上运行速度为20–26 FPS,在800×1100图像上为4–5 FPS,支持实时推理。
- 与单任务基线相比,结合关键点和掩码头的多任务学习使AP提升3.0%,充分体现了辅助监督的强大优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。