[論文レビュー] Contextual Imagined Goals for Self-Supervised Robotic Learning
本論文では、ロボットが生の視覚的観測から自己教師あり強化学習を用いて、状況に配慮した妥当な目標を自律的に生成できる、コンテキスト付き想起目標(CC-RIG)を提案する。文脈に応じた変分オートエンコーダ(CC-VAE)を用いて静的シーンの文脈(例:物体の識別子、照明)と制御可能なオブジェクト状態(例:物体の位置)を分離することで、サンプル効率的かつオフポリシーな操作スキルの学習が可能となり、視覚的多様性を持つ現実世界環境においても、新しいオブジェクトに一般化する。
While reinforcement learning provides an appealing formalism for learning individual skills, a general-purpose robotic system must be able to master an extensive repertoire of behaviors. Instead of learning a large collection of skills individually, can we instead enable a robot to propose and practice its own behaviors automatically, learning about the affordances and behaviors that it can perform in its environment, such that it can then repurpose this knowledge once a new task is commanded by the user? In this paper, we study this question in the context of self-supervised goal-conditioned reinforcement learning. A central challenge in this learning regime is the problem of goal setting: in order to practice useful skills, the robot must be able to autonomously set goals that are feasible but diverse. When the robot's environment and available objects vary, as they do in most open-world settings, the robot must propose to itself only those goals that it can accomplish in its present setting with the objects that are at hand. Previous work only studies self-supervised goal-conditioned RL in a single-environment setting, where goal proposals come from the robot's past experience or a generative model are sufficient. In more diverse settings, this frequently leads to impossible goals and, as we show experimentally, prevents effective learning. We propose a conditional goal-setting model that aims to propose goals that are feasible from the robot's current state. We demonstrate that this enables self-supervised goal-conditioned off-policy learning with raw image observations in the real world, enabling a robot to manipulate a variety of objects and generalize to new objects that were not seen during training.
研究の動機と目的
- 人為的な報酬関数やオブジェクト検出器なしに、視覚的に多様なオープンワールド環境でロボットが自律的に妥当なスキルを発見・訓練できるようにすること。
- 自己教師あり強化学習における目標設定の課題に取り組み、動的または多様なシーンにおいて、非現実的な目標を提示してしまう既存手法の限界を克服すること。
- 訓練時に未観測の新しいオブジェクトに対しても一般化可能なポリシーを、生の画像観測から学習すること。
- 現実世界のロボット操作におけるサンプル効率性と頑健性を向上させるために、現在のシーン文脈に基づいて目標生成を条件づけること。
提案手法
- 文脈に応じた変分オートエンコーダ(CC-VAE)を訓練し、生の画像観測から静的シーン文脈(例:物体の識別子、照明)と制御可能な状態(例:物体の位置)を、潜在変数 $ z_t $ における情報ボトルネックを用いて分離する。
- 初期状態 $ s_0 $ を文脈 $ z_c $ として符号化し、軌道のダイナミクスを $ z_t $ として表現し、ポリシー入力用に結合表現 $ \bar{z}_t = (z_t, z_c) $ を形成する。
- 現在のシーン文脈 $ z_c $ を条件として $ z_t $ を再サンプリングすることで目標を生成し、提案された目標が現在のシーン文脈内で妥当であることを保証する。
- オフポリシー強化学習を用いて、エージェントの最終状態と生成された目標との間の潜在空間距離を最小化するように、目標条件付きポリシーを学習する。
- 密度の高い教師信号を必要とせず、生の画像観測からの学習を可能にするために、潜在距離メトリック(CVAE距離)を報酬信号として用いる。
- 本手法は、20個の訓練用オブジェクトを用いた現実世界のプッシュャーエンターレインメントで評価され、訓練中に未観測の新しいオブジェクトに対してテストが実施された。
実験結果
リサーチクエスチョン
- RQ1視覚的に複雑で多様な現実世界環境において、オブジェクトやタスクに関する事前知識なしに、ロボットが妥当で多様な目標を自己生成できるか?
- RQ2文脈に応じた目標生成は、自己教師ありロボット学習におけるサンプル効率性と一般化性能をどのように向上させるか?
- RQ3多様なオブジェクトで学習したモデルは、訓練時に未観測の新しいオブジェクトに対しても、視覚的観測と自己教師ありの目標設定のみで一般化可能か?
- RQ4シーン文脈と制御可能なダイナミクスを分離することで、視覚ベースの強化学習におけるより頑健で一般化可能なポリシー学習が達成できるか?
主な発見
- CC-RIGは、すべての評価指標で標準的なRIG(ランダム想起目標)を上回り、未学習のオブジェクトにおいてCVAE距離が1.51 ± 0.71を達成したのに対し、RIGは2.37 ± 0.97であった。
- 未学習の新しいオブジェクトにおいて、CC-RIGは中央値の物体位置距離を11.5 ± 2.9 cmに抑え、RIGの17.1 ± 8.2 cmよりも顕著に優れていた。
- 本手法は、訓練分布外の新しいオブジェクトに対しても効果的に一般化でき、視覚的およびオブジェクトレベルの変動に対して頑健であることが示された。
- CC-RIGは、RIGと比較して、目標へのピクセル単位の距離を平均40.8%まで低減し、目標到達の視覚的正確性が向上していることを示している。
- 文脈に応じた目標生成の導入により、非文脈的アプローチで頻発する非現実的な目標の提案をモデルが回避できた。
- 本システムは、色や質感が異なる新しいパックを含む多様なオブジェクトを、生の画像観測と自己教師あり学習のみで現実世界で効果的にプッシュする能力を習得した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。