Skip to main content
QUICK REVIEW

[論文レビュー] Acceleration of Actor-Critic Deep Reinforcement Learning for Visual Grasping in Clutter by State Representation Learning Based on Disentanglement of a Raw Input Image

Tae Won Kim, Yeseong Park|arXiv (Cornell University)|Feb 27, 2020
Advanced Memory and Neural Computing参考文献 36被引用数 7
ひとこと要約

本稿は、雑然としたシーンにおける視覚的 grasping のためのオフポリシー actor-critic 深層強化学習(RL)の高速化を目的として、raw RGB イメージの分離による状態表現学習(SRL)手法を提案する。入力画像をオブジェクトの識別子、位置、その他の要因に分離することで、スパarsely リワードな環境や多様な未観測オブジェクトに対しても、効率的な grasping ポリシーの学習が可能となり、L3 分離を用いた FM+AE ではシミュレーションで 71.9% の成功率を達成した。

ABSTRACT

For a robotic grasping task in which diverse unseen target objects exist in a cluttered environment, some deep learning-based methods have achieved state-of-the-art results using visual input directly. In contrast, actor-critic deep reinforcement learning (RL) methods typically perform very poorly when grasping diverse objects, especially when learning from raw images and sparse rewards. To make these RL techniques feasible for vision-based grasping tasks, we employ state representation learning (SRL), where we encode essential information first for subsequent use in RL. However, typical representation learning procedures are unsuitable for extracting pertinent information for learning the grasping skill, because the visual inputs for representation learning, where a robot attempts to grasp a target object in clutter, are extremely complex. We found that preprocessing based on the disentanglement of a raw input image is the key to effectively capturing a compact representation. This enables deep RL to learn robotic grasping skills from highly varied and diverse visual inputs. We demonstrate the effectiveness of this approach with varying levels of disentanglement in a realistic simulated environment.

研究の動機と目的

  • スパarsely リワードと複雑な視覚入力下における視覚ベースのロボット grasping におけるオフポリシー actor-critic RL の低いサンプル効率と不安定性を解決すること。
  • raw イメージからの分離表現学習が、雑然としたシーンにおける多様で未観測のオブジェクトの grasping ポリシー学習における深層RLの性能向上に寄与するかを調査すること。
  • オブジェクト識別子や位置といった独立した生成要因を分離することで、RL に適したよりコンactかつ情報豊富な状態表現が得られることを示すこと。
  • 実際のシミュレーテッド環境下で、さまざまなレベルの分離度(L0~L3)におけるさまざまな SRL モデル(例:VAE、SAE、FM+AE)の有効性を評価すること。
  • 事前学習済みの SRL モデルを用いて RL 学習を初期化するフレームワークを確立し、SRL と RL を同時に学習する手法と比較して、収束性と最終的性能の向上を示すこと。

提案手法

  • SRL モデルに供給する前に、raw RGB イメージを3段階の分離スキーム(L0:raw イメージ、L1:オブジェクトレベルの分離、L3:識別子、位置、スケール、照明、色の完全な分離)に処理する。
  • 分離済みの画像表現上で、ノイズ除去オートエンコーダ(SAE)、変分オートエンコーダ(VAE)、β-VAE、および特徴マスキングオートエンコーダ(FM+AE)といった複数の SRL モデルを学習させ、コンパクトで分離された潜在状態を学習する。
  • 事前学習済みの SRL モデルを用いて、その後続のオフポリシー actor-critic RL(DDPG および D4PG)のための状態表現を抽出し、表現学習とポリシー学習を分離する。
  • 潜在空間の過剰正則化を避けるために、β-VAE の β を小さい値(β=0.1)に設定し、生成要因の分離を促進する。
  • 2段階のトレーニングパイプラインを導入:まず分離済み画像上で SRL モデルを事前学習し、次に抽出された表現を用いて actor-critic ポリシーを微調整する。
  • SRL を用いた RL と、SRL と RL を同時に学習する手法、およびエンドツーエンドの RL を比較し、事前学習済みの分離表現の利点を示す。

実験結果

リサーチクエスチョン

  • RQ1raw 入力画像の分離が、スパarsely リワードな視覚的 grasping タスクにおけるオフポリシー actor-critic 深層RLのサンプル効率と最終的性能を顕著に向上させるか?
  • RQ2分離度(L0 から L3)のレベルが、さまざまな SRL モデルの性能にどのように影響するか?特に、多様で未観測のオブジェクトの grasping ポリシー学習に寄与するか?
  • RQ3SRL アーキテクチャ(例:SAE、VAE、β-VAE、FM+AE)の中で、分離表現と組み合わせた場合、ロボット grasping における性能が最も優れるのはどれか?
  • RQ4SRL モデルを RL 学習前に事前学習することで、SRL と RL を同時に学習する手法と比較して性能が向上するか?
  • RQ5複雑で雑然とした視覚入力に適用した場合、β-VAE のハイパーパrameter β に対する性能の感度はどの程度か?

主な発見

  • 分離済みの画像表現の使用により、オフポリシー actor-critic RL の grasping 成功率が顕著に向上し、L3 分離を用いた FM+AE が最も高い性能(71.9%)を達成した。
  • raw 入力画像(L0)および低レベルの分離(L1)では、有効な学習が不可能であることが示され、ポリシー学習には十分に構造化された表現が必要であることがわかった。
  • β=0.1 の β-VAE が VAE のバリエーションの中で最も優れた性能を示したが、β を大きく(例:β=2)すると性能が低下した。これは、複雑な入力において過剰正則化が学習を損なう可能性を示唆している。
  • SAE は L2 分離で最高の性能を示した。これは、標準的なオートエンコーダとは異なり、独自のエンコーダ構造が空間特徴を異なる方法で捉えているためと考えられる。
  • SRL と RL を同時に学習する手法は、L3 分離でさえ完全に失敗した。これは、エージェントとクライアントネットワークの相互依存性に起因し、分離された事前学習の利点を強調している。
  • D4PG アルゴリズムは DDPG よりも優れた性能を示したが、両者とも事前学習済み表現を用いることで顕著に性能向上を示し、最良の手法と同等の成功率にまで到達した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。