Skip to main content
QUICK REVIEW

[論文レビュー] Visual Foresight Tree for Object Retrieval from Clutter with Nonprehensile Rearrangement

Baichuan Huang, Shuai D. Han|arXiv (Cornell University)|May 6, 2021
Robotics and Sensor-Based Localization参考文献 52被引用数 4
ひとこと要約

本稿では、視覚的予測(Visual Foresight)を用いたツリー探索を可能にするモデルベース手法である Visual Foresight Tree (VFT) を提案する。この手法は、深層ニューラルネットワークを用いてロボットの押し動作用の物体再配置を予測し、視覚的予測に基づくツリー探索を効率的に行うことで、ごみだらけの状況における非捕捉的プッシュシーケンスの計画を可能にする。シミュレーションおよび実世界の実験において、モデルフリー法や短視眼的モデルベース法と比較して、より高い成功確率と少ないアクション数を達成している。

ABSTRACT

This paper considers the problem of retrieving an object from a set of tightly packed objects by using a combination of robotic pushing and grasping actions. Object retrieval from confined spaces that contain clutter is an important skill for robots in order to effectively operate in households and everyday environments. The proposed solution, Visual Foresight Tree (VFT), cleverly rearranges the clutter surrounding the target object so that it can be grasped easily. Rearrangement with nested non-prehensile actions is challenging as it requires predicting complex object interactions in a combinatorially large configuration space of multiple objects. We first show that a deep neural network can be trained to accurately predict the poses of the packed objects when the robot pushes one of them. The predictive network provides visual foresight and is used in a tree search as a state transition function in the space of scene images. The tree search returns a sequence of consecutive push actions that result in the best arrangement of the clutter for grasping the target object. Experiments in simulation and using a real robot and objects show that the proposed approach outperforms model-free techniques as well as model-based myopic methods both in terms of success rates and the number of executed actions, on several challenging tasks. A video introducing VFT, with robot experiments, is accessible at this https URL. Full source code will also be made available upon publication of this manuscript.

研究の動機と目的

  • 家庭環境における密に詰められたごみの中からターゲットオブジェクトを回収する課題に対処すること。
  • 高次元的かつ組み合わせ的に複雑な配置空間における非捕捉的再配置計画の難しさを克服すること。
  • 視覚的予測を用いた長時間計画によって、物体回収の成功確率を向上させるとともに、アクション数を削減すること。
  • 学習された視覚予測と探索ベースの計画を統合することで、多様なごみだらけのシーンに一般化可能な手法を開発すること。

提案手法

  • 1回のプッシュ行動後の、ごみだらけのシーンにおけるオブジェクトの新しいポーズを予測するための深層ニューラルネットワークを学習する。
  • 学習済みネットワークは、視覚的予測モデルとして機能し、シーン画像から将来のシーン画像への状態遷移予測を提供する。
  • ツリー探索アルゴリズムが視覚的予測モデルを用いてプッシュ行動のシーケンスをシミュレートし、その結果を評価する。
  • 探索は、画像に基づくシーン状態の空間を探索し、ターゲットオブジェクトをつかみやすい位置に最適に再配置するプッシュのシーケンスを見つける。
  • 学習されたダイナミクスと記号的ツリー探索を統合することで、明示的な世界モデルを必要とせずに長時間計画を実現する。
  • 本手法は、シミュレーションおよび実際のロボットでも評価されており、現実世界のダイナミクスや視覚的ノイズに対しても頑健であることが示された。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、ごみだらけのオブジェクト配置における1回のプッシュの結果を高精度に予測できるか?
  • RQ2視覚的予測に基づくツリー探索は、モデルフリー強化学習と比較して、ごみだらけの物体回収において成功確率とサンプル効率の点で優れているか?
  • RQ3視覚的予測を用いるモデルベース計画法は、複雑で高次元的な再配置タスクにおいて、短視眼的モデルベース法を上回る性能を示せるか?
  • RQ4本手法は、多様なごみだらけのシーンやオブジェクト配置にどの程度一般化できるか?

主な発見

  • 視覚的予測ネットワークは、ごみだらけのシーンにおけるプッシュ行動後のオブジェクト再配置予測において高い精度を達成した。
  • VFT手法は、モデルフリー強化学習のベースラインと比較して、成功確率と必要なアクション数の両面で顕著に優れていた。
  • 本手法は、特に複雑で密に詰められた配置において、短視眼的モデルベース法よりも高い成功確率を達成した。
  • 本手法は、実世界のシナリオにうまく一般化し、ドメインランダマイゼーションを最小限に抑えた物理的ロボットでも頑健な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。