[論文レビュー] Efficient learning of goal-oriented push-grasping synergy in clutter
本論文は、ごみだらけの環境下での目的指向型プッシュ・グラッピングタスクにおけるサンプル効率の向上を図る、目的条件付き階層強化学習フレームワークを提案する。ゴールリレイヤリングと敵対的訓練を用いることで、グラッピング行動がプッシュをガイドするディスクリミネータとして機能し、報酬を密にすることで、より速く効果的な学習を可能にする。本手法は、より少ないアクション数でタスク完了率とグラップ成功率を向上させ、微調整なしに現実世界の設定へ一般化でき、目的指向的および目的無差別的条件下でも良好な性能を発揮する。
We focus on the task of goal-oriented grasping, in which a robot is supposed to grasp a pre-assigned goal object in clutter and needs some pre-grasp actions such as pushes to enable stable grasps. However, in this task, the robot gets positive rewards from environment only when successfully grasping the goal object. Besides, joint pushing and grasping elongates the action sequence, compounding the problem of reward delay. Thus, sample inefficiency remains a main challenge in this task. In this paper, a goal-conditioned hierarchical reinforcement learning formulation with high sample efficiency is proposed to learn a push-grasping policy for grasping a specific object in clutter. In our work, sample efficiency is improved by two means. First, we use a goal-conditioned mechanism by goal relabeling to enrich the replay buffer. Second, the pushing and grasping policies are respectively regarded as a generator and a discriminator and the pushing policy is trained with supervision of the grasping discriminator, thus densifying pushing rewards. To deal with the problem of distribution mismatch caused by different training settings of two policies, an alternating training stage is added to learn pushing and grasping in turn. A series of experiments carried out in simulation and real world indicate that our method can quickly learn effective pushing and grasping policies and outperforms existing methods in task completion rate and goal grasp success rate by less times of motion. Furthermore, we validate that our system can also adapt to goal-agnostic conditions with better performance. Note that our system can be transferred to the real world without any fine-tuning. Our code is available at https://github.com/xukechun/Efficient_goal-oriented_push-grasping_synergy.
研究の動機と目的
- ごみの多いシーンにおける目的指向型プッシュ・グラッピングタスクにおける報酬の疎らさとサンプル非効率性の課題に対処すること。
- 特定のターゲットオブジェクトを分離し、それをグラブできるように、プッシュとグラッピングのポリシーを連携して効率的に学習すること。
- 微調整なしにシミュレーションから現実世界への一般化を実現すること。
- ターゲットに依存する条件付けを排除することで、目的無差別的シナリオへの適用性を拡張すること。
提案手法
- プッシュとグラッピングを別々のが制御するが連携するポリシーとして構造化する目的条件付き階層強化学習問題に定式化する。
- リプレイバッファでゴールリレイヤリングを採用し、経験データを豊かにすることで、サンプル効率を向上させる。具体的には、非ターゲットオブジェクトを成功裏にグラブした場合に、それらに別のゴールを再割り当てする。
- グラッピングポリシーをディスクリミネータとして用いる敵対的訓練機構を導入し、プッシュ行動に対して密で情報豊富な報酬を提供する。
- プッシュとグラッピングポリシーの訓練ダイナミクスの違いに起因する分布シフトを軽減するため、交互に訓練を行う。
- システムをシミュレーションでエンドツーエンドに訓練し、追加の微調整なしに現実世界の環境へそのままで転送する。
- 観測空間にゴールマスクを適用してポリシーをターゲットオブジェクトに条件づけるが、目的無差別的動作のためにはこの要件を除外可能とする。
実験結果
リサーチクエスチョン
- RQ1目的指向型プッシュ・グラッピングタスクにおいて、報酬が疎らである状況で、どのようにサンプル効率を向上させることができるか?
- RQ2プッシュとグラッピングポリシー間の敵対的訓練によって、報酬を密にし、ポリシー学習を改善できるか?
- RQ3プッシュとグラッピングポリシーの交互訓練は、階層強化学習における分布シフトをどのように軽減するか?
- RQ4シミュレーションで訓練されたポリシーが、微調整なしに現実世界環境へどの程度一般化できるか?
- RQ5同じフレームワークが、目的指向的および目的無差別的グラッピングシナリオの両方で効果的に機能するか?
主な発見
- シミュレーションでは、本手法は困難な配置条件下で93.3%のタスク完了率と86.6%のグラップ成功率を達成し、Grasping the Invisibleなどのベースラインを上回った。
- 困難なケースにおいて、平均的な動き回数を1タスクあたり4.62アクションにまで削減し、行動効率の向上を示した。
- 現実世界の実験では、困難な配置条件下で93.3%の完了率と86.6%のグラップ成功率を達成し、ベースライン手法(86.7%と75.2%)を上回った。
- 本システムは、形状が複雑な未確認のオブジェクトに対しても一般化できたが、完全に新しい形状のオブジェクトでは失敗事例が発生した。
- 目的無差別的条件下では、VPGに比べて12.4%高い完了率と5.3%高いグラップ成功率を達成した。
- 本システムは、微調整なしにシミュレーションから現実世界へ転送され、強力なゼロショット一般化を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。