[论文解读] 6DoF Object Pose Estimation via Differentiable Proxy Voting Loss
本文提出了一种可微分代理投票损失(DPVL),用于6DoF物体位姿估计,通过引入像素到关键点的距离,改进了向量场回归,减少了因方向向量不准确而导致的假设偏差。DPVL支持端到端训练,在LINEMOD和Occlusion LINEMOD数据集上实现了最先进性能,并加快了收敛速度。
Estimating a 6DOF object pose from a single image is very challenging due to occlusions or textureless appearances. Vector-field based keypoint voting has demonstrated its effectiveness and superiority on tackling those issues. However, direct regression of vector-fields neglects that the distances between pixels and keypoints also affect the deviations of hypotheses dramatically. In other words, small errors in direction vectors may generate severely deviated hypotheses when pixels are far away from a keypoint. In this paper, we aim to reduce such errors by incorporating the distances between pixels and keypoints into our objective. To this end, we develop a simple yet effective differentiable proxy voting loss (DPVL) which mimics the hypothesis selection in the voting procedure. By exploiting our voting loss, we are able to train our network in an end-to-end manner. Experiments on widely used datasets, i.e., LINEMOD and Occlusion LINEMOD, manifest that our DPVL improves pose estimation performance significantly and speeds up the training convergence.
研究动机与目标
- 为解决单张RGB图像在遮挡和无纹理外观条件下6DoF位姿估计不准确的挑战。
- 减少因远离关键点的像素处方向向量误差较小而导致的关键点投票中假设偏差。
- 设计一种可微分损失,模拟投票过程以实现端到端训练,克服传统投票方法(如RANSAC)的不可微性。
- 在不重新训练遮挡数据的情况下,提升位姿估计的鲁棒性与训练收敛速度。
- 通过考虑方向向量准确度与像素到关键点距离的代理假设,实现精确的关键点定位。
提出的方法
- DPVL为每个像素引入一个代理假设,即通过真实关键点向由像素及其预测方向向量所定义的直线作垂线,垂足即为代理假设。
- 损失函数最小化每个代理假设与其对应真实关键点之间的距离,同时整合方向向量准确度与空间距离。
- 垂足计算过程是可微分的,使得在端到端训练中可通过反向传播优化投票近似过程。
- 该方法通过可学习权重λ将代理投票损失与标准向量场回归损失相结合,平衡两项目标。
- 网络架构与数据处理流程与PVNet保持一致,以确保公平比较,仅损失函数被修改。
- 训练收敛速度显著加快,模型在100个训练轮次内达到最优性能,而PVNet需200轮。
实验结果
研究问题
- RQ1如何通过可微分监督改进在遮挡和无纹理条件下6DoF物体位姿估计?
- RQ2为何小的方向向量误差会导致基于投票的关键点估计中产生大的假设偏差?
- RQ3能否设计一种可微分损失,以近似投票过程并考虑像素到关键点的距离?
- RQ4在损失中引入空间距离是否能提升关键点定位精度与训练收敛速度?
- RQ5在不重新训练遮挡数据的情况下,可微分代理投票损失是否能超越标准向量场回归方法?
主要发现
- 所提出的DPVL在LINEMOD和Occlusion LINEMOD数据集上均达到最先进性能,优于PVNet及其他SOTA方法。
- 在Occlusion LINEMOD数据集上,该方法取得了最佳整体ADD(-S)得分,表明其对遮挡具有更强的鲁棒性。
- 模型收敛速度显著提升,仅用100个训练轮次即达最优性能,而PVNet需200轮。
- 代理假设的分布更集中于真实关键点周围,表明向量场质量与投票一致性得到改善。
- 消融实验表明λ = 1e-3提供了最佳平衡,过大或过小的值均会降低性能。
- 该方法泛化能力良好,在未微调遮挡数据的情况下仍取得优异结果,而其他方法需在该类数据上重新训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。