Skip to main content
QUICK REVIEW

[論文レビュー] Object Finding in Cluttered Scenes Using Interactive Perception

Tonči Novković, Rémi Pautrat|arXiv (Cornell University)|Nov 18, 2019
Reinforcement Learning in Robotics参考文献 29被引用数 6
ひとこと要約

本稿では、RGB-Dセンシングを備えたロボットアームを用いたごみだらけのシーンにおけるオブジェクト探索のための強化学習(RL)ベースのアクティブでインタラクティブな認識システムを提案する。圧縮された切り捨てられた符号付き距離場(TSDF)表現とエンドツーエンドのRLポリシー学習を活用することで、シミュレーションで88%以上の成功率、実世界の実験で100%の成功率を達成し、微調整なしに未知のオブジェクト形状やサイズにも効果的に一般化できる。

ABSTRACT

Object finding in clutter is a skill that requires perception of the environment and in many cases physical interaction. In robotics, interactive perception defines a set of algorithms that leverage actions to improve the perception of the environment, and vice versa use perception to guide the next action. Scene interactions are difficult to model, therefore, most of the current systems use predefined heuristics. This limits their ability to efficiently search for the target object in a complex environment. In order to remove heuristics and the need for explicit models of the interactions, in this work we propose a reinforcement learning based active and interactive perception system for scene exploration and object search. We evaluate our work both in simulated and in real-world experiments using a robotic manipulator equipped with an RGB and a depth camera, and compare our system to two baselines. The results indicate that our approach, trained in simulation only, transfers smoothly to reality and can solve the object finding task efficiently and with more than 88% success rate.

研究の動機と目的

  • ごみくずの多い環境におけるオブジェクト探索のための、ロバストでエンドツーエンドのRLベースの手法を開発すること。
  • ロボットのシーン探索における、手作業で設計されたヒューリスティクスや事前定義された相互作用ポリシーへの依存を排除すること。
  • 実世界のロボットシステムへのゼロショット転送を可能にし、実データの微調整なしに運用できること。
  • トレーニング中に見られなかった多様なオブジェクト形状やサイズに対しても一般化できること。
  • 圧縮されたボリュメトリックなシーン表現を用いて、効率的な探索および終了ポリシーを学習すること。

提案手法

  • 3次元シーン状態を圧縮可能で学習可能な表現としてエンコードするため、離散化された切り捨てられた符号付き距離場(TSDF)を用いる。
  • 現在のシーン状態に基づいて行動を選択するRLポリシーを学習するため、経験再生を用いたディープQネットワーク(DQN)を採用する。
  • ターゲットオブジェクトをその色に基づいて同定するための学習済みカラーディテクタを統合する(ターゲットが色指定であることを仮定)。
  • 隠れていないターゲットを特定するために、カメラの移動(視点変更)と物理的相互作用(オブジェクトの押し動かし)を含む行動空間を設計する。
  • ターゲット検出と探索進捗に基づくスパarsな密集報酬を用いて、シミュレーション内でのみエージェントを訓練する。
  • 実世界への転送を向上させるために、ドメインランダマイゼーションとタスク固有の増強を適用し、実世界の微調整なしに運用可能にする。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドのRLポリシーは、事前定義されたヒューリスティクスなしに、ごみくずの多い3次元シーンを効率的に探索・相互作用し、ターゲットオブジェクトを特定できるか?
  • RQ2シミュレーションで訓練されたポリシーは、実世界のロボットシステムにおいて、インタラクティブなオブジェクト探索にどの程度一般化できるか?
  • RQ3トレーニング時に見られなかった新しいオブジェクト形状やサイズに対し、この手法はどの程度一般化できるか?
  • RQ4本稿で提案するRLベースのアプローチは、GES や GNBV といったヒューリスティックベースのベースラインと比較して、効率性および成功確率で優れているか?
  • RQ5局所的なシーン情報が限られている状況でも、ターゲットが存在しない場合に適切にエピソードを終了できるように学習できるか?

主な発見

  • 提案されたA3DEおよびI3DE RLエージェントは、シミュレーテッドなごみくずの多いシーンで88%以上の成功率を達成し、両方のベースライン(GNBVおよびGES)を効率性と成功確率の面で上回った。
  • I3DEエージェントは、ロボットアームを搭載した実世界実験で100%の成功率を達成し、実データの微調整なしに、シミュレーションから実世界への強力な転送性を示した。
  • 変動するサイズのプリミティブ、ランダムな形状、実際のオブジェクトモデルを含む新しいオブジェクトタイプに対しても、効果的に一般化でき、性能低下が最小限に抑えられた。
  • 特に複雑なシーンでは、I3DEエージェントはGESベースラインよりもはるかに少ないステップ数でタスクを完了したため、探索効率が向上したことが示された。
  • ターゲットオブジェクトが存在しない場合の試行の96.1%で、エージェントは適切にエピソードを終了することができ、探索完了の検出が有効に行われた。
  • GESベースラインはトレーニングドメイン内では非常に効果的であったが、オブジェクトのスケールが変化すると一般化に失敗したため、ヒューリスティックベースの手法の限界が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。