Skip to main content
QUICK REVIEW

[论文解读] PoseAgent: Budget-Constrained 6D Object Pose Estimation via Reinforcement Learning

Alexander Krull, Eric Brachmann|arXiv (Cornell University)|Dec 12, 2016
Robotics and Sensor-Based Localization参考文献 22被引用 6
一句话总结

PoseAgent 提出了一种强化学习方法,在计算预算约束下优化6D物体位姿估计,通过策略梯度学习随机策略以选择并优化位姿假设。该方法在平均精炼步骤更少的情况下实现了最先进水平的准确性,实现了对非可微算法流水线的可微、端到端训练。

ABSTRACT

State-of-the-art computer vision algorithms often achieve efficiency by making discrete choices about which hypotheses to explore next. This allows allocation of computational resources to promising candidates, however, such decisions are non-differentiable. As a result, these algorithms are hard to train in an end-to-end fashion. In this work we propose to learn an efficient algorithm for the task of 6D object pose estimation. Our system optimizes the parameters of an existing state-of-the art pose estimation system using reinforcement learning, where the pose estimation system now becomes the stochastic policy, parametrized by a CNN. Additionally, we present an efficient training algorithm that dramatically reduces computation time. We show empirically that our learned pose estimation procedure makes better use of limited resources and improves upon the state-of-the-art on a challenging dataset. Our approach enables differentiable end-to-end training of complex algorithmic pipelines and learns to make optimal use of a given computational budget.

研究动机与目标

  • 为以端到端方式训练复杂且不可微的6D物体位姿估计算法流水线提供解决方案。
  • 通过学习动态的假设选择与精炼决策,实现对有限计算资源的高效利用。
  • 通过可微的策略梯度方法,克服位姿估计中离散决策与奖励函数的不可微性。
  • 开发一种高效训练算法,显著降低梯度方差,同时不增加计算时间。

提出的方法

  • 将6D物体位姿估计重新表述为强化学习问题,将推理过程建模为随机策略。
  • 策略由一个卷积神经网络(CNN)参数化,输出从候选池中选择和精炼位姿假设的动作概率。
  • 使用随机策略梯度方法反向传播通过不可微决策,实现端到端训练。
  • 提出一种高效训练算法,通过重用多个轨迹中的中间计算,降低梯度方差。
  • 引入温度参数 τ_max 控制动作选择的粒度,实现精细探索。
  • 采用类似课程学习的训练策略,逐步增加 τ_max 值,以提升策略在不同预算设置下的泛化能力。

实验结果

研究问题

  • RQ1强化学习能否用于训练可微策略,以在不可微的6D位姿估计流水线中选择并精炼位姿假设?
  • RQ2与最先进基线方法相比,该方法是否在使用更少平均精炼步骤的同时提升准确性?
  • RQ3该策略是否无需微调即可在不同计算预算设置下实现良好泛化?
  • RQ4所提出的方差减少技术在加速和稳定策略梯度训练方面效果如何?
  • RQ5该方法能否通过动态分配精炼步骤给最有希望的假设,实现对固定预算的最优利用?

主要发现

  • 在 Cat 2 基准测试中,PoseAgent 在 N=210 的假设池下达到 76.29% 的正确位姿率,优于先前最先进方法(Krull et al.)4.77 个百分点。
  • 在更大的 N=420 假设池下,PoseAgent 在 Cat 2 上达到 76.29% 的准确率,相比相同预算约束下的基线方法提升 5.52 个百分点。
  • 与朴素的 REINFORCE 实现相比,该方法将梯度方差降低超过 90%,且计算时间增加极少。
  • PoseAgent 在不同 τ_max 值下泛化良好,即使在 τ_max=7 的测试条件下(训练时 τ_max=3),仍能取得更高准确率。
  • 平均而言,PoseAgent 使用的精炼步骤少于基线方法(例如,在 N=210 的 Cat 2 上,分别为 66.60 与 68.71 步),表明其计算效率更高。
  • 该模型在所有测试数据集(Cat 2、Samurai 2、Toolbox 2)上均提升了准确率,并在总平均得分上表现最佳,甚至超过 'BestRef' 基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。