Skip to main content
QUICK REVIEW

[論文レビュー] PoseAgent: Budget-Constrained 6D Object Pose Estimation via Reinforcement Learning

Alexander Krull, Eric Brachmann|arXiv (Cornell University)|Dec 12, 2016
Robotics and Sensor-Based Localization参考文献 22被引用数 6
ひとこと要約

PoseAgentは、計算リソースの制約のもとで6次元オブジェクトポーズ推定を最適化する強化学習アプローチを提案する。ポリシー勾配を用いて確率的方策を学習し、ポーズ仮説の選択と精錬を行う。先行手法よりも平均的な精錬ステップ数を減らしながら最先端の精度を達成しており、非微分可能なアルゴリズムパイプラインの微分可能でエンドツーエンドの訓練を可能にする。

ABSTRACT

State-of-the-art computer vision algorithms often achieve efficiency by making discrete choices about which hypotheses to explore next. This allows allocation of computational resources to promising candidates, however, such decisions are non-differentiable. As a result, these algorithms are hard to train in an end-to-end fashion. In this work we propose to learn an efficient algorithm for the task of 6D object pose estimation. Our system optimizes the parameters of an existing state-of-the art pose estimation system using reinforcement learning, where the pose estimation system now becomes the stochastic policy, parametrized by a CNN. Additionally, we present an efficient training algorithm that dramatically reduces computation time. We show empirically that our learned pose estimation procedure makes better use of limited resources and improves upon the state-of-the-art on a challenging dataset. Our approach enables differentiable end-to-end training of complex algorithmic pipelines and learns to make optimal use of a given computational budget.

研究の動機と目的

  • 6次元オブジェクトポーズ推定のための複雑で非微分可能なアルゴリズムパイプラインをエンドツーエンドで学習する課題に対処すること。
  • 動的仮説選択と精錬意思決定を学習することで、限られた計算リソースを効率的に活用できること。
  • ポーズ推定における離散的決定と報酬関数の非微分可能性を、微分可能なポリシー勾配アプローチで克服すること。
  • 勾配の分散を大幅に低減するが計算時間の増加を最小限に抑える効率的な学習アルゴリズムの開発すること。

提案手法

  • 推論プロセスを確率的方策としてモデル化することで、6次元オブジェクトポーズ推定を強化学習問題に再定式化する。
  • ポリシーは、プールからポーズ仮説の選択と精錬のための行動確率を出力するCNNによってパラメータ化される。
  • 非微分可能な意思決定を逆伝播可能にするために、確率的ポリシー勾配手法を用い、エンドツーエンドの訓練を可能にする。
  • 複数のロールアウト間で中間計算を再利用することで、勾配の分散を低減する効率的な学習アルゴリズムを導入する。
  • 行動選択の細かさを制御するための温度パラメータτ_maxを導入し、微調整された探索を可能にする。
  • 訓練を段階的に進めるカリキュラムのような戦略を採用し、τ_maxの値を徐々に増加させることで、異なるリソース制約設定におけるポリシーの汎化能力を向上させる。

実験結果

リサーチクエスチョン

  • RQ1非微分可能な6次元ポーズ推定パイプラインにおいて、強化学習を用いて仮説選択と精錬のための微分可能なポリシーを学習できるか?
  • RQ2提案手法は、最先端のベースラインと比較して、より少ない平均的な精錬ステップ数で精度を向上させられるか?
  • RQ3再訓練なしで、異なる計算リソース制約設定においてもポリシーが汎化できるか?
  • RQ4提案された分散低減技術は、ポリシー勾配訓練の加速と安定化にどの程度効果的か?
  • RQ5固定されたリソース予算のもとで、有望な仮説に最適に精錬ステップを割り当てることで、最適なリソース配分が可能になるか?

主な発見

  • Cat 2ベンチマークにおいて、N=210の仮説プールを用いたPoseAgentは76.29%の正しく推定されたポーズを達成し、先行の最先端手法(Krull et al.)を4.77ポイント上回った。
  • N=420のより大きなプールを用いた場合、PoseAgentはCat 2で76.29%の精度を達成し、同じリソース制約下でベースライン手法よりも5.52ポイント向上した。
  • ナイーブなREINFORCE実装と比較して、勾配の分散を90%以上低減したが、計算時間の増加は最小限に抑えられた。
  • PoseAgentはτ_maxの値が異なる設定に対しても良好に汎化し、τ_max=7でテストした際でさえ、τ_max=3で訓練した場合と同等以上の精度を達成した。
  • 平均して、PoseAgentはベースライン手法よりも少ない精錬ステップ数(例:N=210のCat 2では66.60対68.71ステップ)を用いており、計算効率が優れていることが示された。
  • 全テストデータセット(Cat 2、Samurai 2、Toolbox 2)において精度が向上し、合計平均スコアにおいても「BestRef」ベースラインを上回る最高のパフォーマンスを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。