Skip to main content
QUICK REVIEW

[论文解读] W-PoseNet: Dense Correspondence Regularized Pixel Pair Pose Regression

Zelin Xu, Ke Chen|arXiv (Cornell University)|Dec 26, 2019
Robot Manipulation and Learning参考文献 46被引用 16
一句话总结

该论文提出 W-PoseNet,一种新颖的 6D 物体位姿估计网络,通过低秩双线性池化(low-rank bilinear pooling)从稀疏像素对回归位姿,并利用到规范 3D 坐标系的密集对应映射来正则化特征。该方法在 YCB-Video 和 LineMOD 基准测试中达到最先进性能,无需微调即比 DenseFusion 提升高达 7%,并在遮挡条件下表现出更优的鲁棒性。

ABSTRACT

Solving 6D pose estimation is non-trivial to cope with intrinsic appearance and shape variation and severe inter-object occlusion, and is made more challenging in light of extrinsic large illumination changes and low quality of the acquired data under an uncontrolled environment. This paper introduces a novel pose estimation algorithm W-PoseNet, which densely regresses from input data to 6D pose and also 3D coordinates in model space. In other words, local features learned for pose regression in our deep network are regularized by explicitly learning pixel-wise correspondence mapping onto 3D pose-sensitive coordinates as an auxiliary task. Moreover, a sparse pair combination of pixel-wise features and soft voting on pixel-pair pose predictions are designed to improve robustness to inconsistent and sparse local features. Experiment results on the popular YCB-Video and LineMOD benchmarks show that the proposed W-PoseNet consistently achieves superior performance to the state-of-the-art algorithms.

研究动机与目标

  • 解决在遮挡、对称性和纹理变化条件下,RGB-D 图像中 6D 物体位姿估计的挑战。
  • 通过用密集像素到 3D 坐标对应映射替代稀疏关键点监督,提升特征的判别能力与鲁棒性。
  • 通过像素对之间的相对几何与纹理编码,结合局部特征,增强全局位姿表征能力。
  • 通过设计更鲁棒的端到端回归网络,消除对迭代微调的依赖。
  • 证明联合学习像素对特征与密集对应关系可优于标准的逐像素回归方法。

提出的方法

  • 引入像素对位姿回归模块,利用低秩双线性池化(LRBP)将两个采样像素的特征进行组合,编码其相对 3D 几何关系与 2D 纹理关系。
  • 采用密集对应映射(DCM)分支,将每个像素的 2D 图像坐标回归到规范物体模型空间中的对应 3D 点,提供辅助监督信号。
  • 使用联合损失函数,结合位姿回归损失与 DCM 损失,实现多任务监督下的端到端训练。
  • 复用 DenseFusion 的相同密集特征编码器与融合模块,确保公平比较,同时隔离新组件的贡献。
  • 通过共享的微调网络进行迭代位姿微调,进一步提升性能,与先前最先进方法保持一致。

实验结果

研究问题

  • RQ1与标准的逐像素特征回归相比,像素对特征编码是否能提升 6D 位姿估计的鲁棒性?
  • RQ2从像素到规范 3D 坐标学习密集对应关系,是否能增强特征判别能力,并减少对称位姿带来的歧义?
  • RQ3在遮挡条件下,像素对特征与 DCM 监督的结合在准确率与鲁棒性方面相较于现有方法表现如何?
  • RQ4所提方法在多大程度上减少了对 ICP 等迭代微调方法的依赖?
  • RQ5联合学习位姿与对应关系是否能在多样化基准上实现一致的性能提升?

主要发现

  • 在 LineMOD 数据集上,W-PoseNet 在无需迭代微调的情况下达到 97.2% 的平均 ADD(S),相比 DenseFusion 提升 7%(97.2% vs. 90.2%)。
  • 在 YCB-Video 数据集上,W-PoseNet 在不断增加的遮挡水平下持续优于 PoseCNN+ICP 与 DenseFusion,展现出更优的鲁棒性。
  • 消融实验表明,仅使用像素对位姿预测即可使性能相比 DenseFusion 提升 2%(88.2% vs. 86.2% 平均 ADD(S))。
  • 仅使用密集对应映射(DCM)分支即可在性能上相比 DenseFusion 提升 7%,证明其在提升局部特征质量方面的有效性。
  • 在 ELS、CON 与 LRBP 中,低秩双线性池化(LRBP)在特征融合中表现最佳,证实其在捕捉二阶统计特性方面的有效性。
  • 通过迭代微调,W-PoseNet 进一步提升性能,证实所提架构与现有微调流水线兼容且可增强其效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。