[论文解读] Continuous Surface Embeddings
本文提出连续表面嵌入(CSE),一种可学习的基于图像的表示方法,通过从2D图像像素预测3D网格顶点嵌入,建立密集对应关系。通过用连续、变形不变的嵌入空间替代基于图块的回归方法,CSE简化了DensePose框架,消除了接缝问题,并实现了在新动物类别上的零样本迁移,仅需极少标注,且在人体和动物姿态估计基准上达到了最先进性能。
In this work, we focus on the task of learning and representing dense correspondences in deformable object categories. While this problem has been considered before, solutions so far have been rather ad-hoc for specific object types (i.e., humans), often with significant manual work involved. However, scaling the geometry understanding to all objects in nature requires more automated approaches that can also express correspondences between related, but geometrically different objects. To this end, we propose a new, learnable image-based representation of dense correspondences. Our model predicts, for each pixel in a 2D image, an embedding vector of the corresponding vertex in the object mesh, therefore establishing dense correspondences between image pixels and 3D object geometry. We demonstrate that the proposed approach performs on par or better than the state-of-the-art methods for dense pose estimation for humans, while being conceptually simpler. We also collect a new in-the-wild dataset of dense correspondences for animal classes and demonstrate that our framework scales naturally to the new deformable object categories.
研究动机与目标
- 开发一种可扩展、自动化的端到端方法,用于在无需手动划分图块或每类别标注的情况下,学习2D图像与3D物体几何结构之间的密集对应关系。
- 通过学习共享的、通用的3D表面点嵌入空间,实现在可变形物体类别(如人体到动物)之间的知识迁移。
- 通过消除图块划分及其相关接缝,简化DensePose框架的预测过程。
- 利用功能映射和规范3D形状之间的嵌入对齐,实现低数据量、多类别密集对应学习。
- 证明单一通用网络可在极少微调和标注的情况下泛化至多样化的动物类别。
提出的方法
- 为规范形状 $S$ 上的每个3D网格顶点 $X$ 引入可学习的位置嵌入 $e_X$,形成对形变不变的表示。
- 训练深度神经网络以预测每个图像像素的嵌入向量 $e_X$,直接将像素与3D几何结构关联,无需中间的UV坐标。
- 使用基于Sigmoid函数的对比损失 $\mathcal{L}_\sigma$,以提升低数据场景下的鲁棒性并实现更好的泛化能力。
- 应用功能映射对齐不同3D模型(如人体到黑猩猩)之间的嵌入,实现跨类别的知识迁移。
- 采用共享嵌入空间并结合类别无关的训练与网格特定的顶点嵌入对齐,以提升多类别性能。
- 利用人体数据进行预训练,并通过极少标注进行微调,实现向新动物类别的迁移。
实验结果
研究问题
- RQ1能否通过单一、通用的深度神经网络,在极少监督条件下,为多个可变形物体类别预测密集对应关系?
- RQ2用连续表面嵌入替代基于图块的UV回归,是否能提升性能并简化学习流程?
- RQ3在某一类别(如人体)上学习的嵌入,通过功能映射对齐,能否有效迁移到另一类别(如动物)?
- RQ4所提方法是否能在显著降低标注成本的前提下,实现在密集姿态估计任务上的最先进性能?
- RQ5与标准回归损失相比,使用对比损失 $\mathcal{L}_\sigma$ 是否能提升低数据场景下的泛化能力?
主要发现
- CSE模型在DensePose-COCO基准上达到最先进性能,SMPL网格的GPSm得分为35.0,黑猩猩网格为30.9,优于标准DensePose方法。
- 使用 $\mathcal{L}_\sigma$ 损失在低数据场景下显著提升了泛化能力,在LVIS数据集上达到25.2的平均GPSm,而标准损失 $\mathcal{L}$ 仅为9.5。
- 采用类别无关训练与共享嵌入,并结合网格对齐,提升了多类别性能,在LVIS数据集上实现35.0的平均GPSm。
- 在人体数据上预训练预测器 $\Phi$ 并对齐顶点嵌入,使黑猩猩数据集上的性能提升超过10分,达到37.2的GPSm。
- 该方法成功泛化至LVIS数据集中的10种动物类别,仅使用原始标注的10%即实现35.0的平均GPSm,展现出强大的少样本迁移能力。
- 连续嵌入表示消除了图块之间的接缝,相比基于图块的方法,生成了更平滑、更一致的密集对应关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。