Skip to main content
QUICK REVIEW

[論文レビュー] Learning Robot Skills with Temporal Variational Inference

Tanmay Shankar, Abhinav Gupta|arXiv (Cornell University)|Jun 29, 2020
Machine Learning and Algorithms被引用数 13
ひとこと要約

本論文は、教師なしの方法で、区切りのないロボットのデモデータから低レベルの制御方策と高レベルのオプションを同時に学習する時間的変分推論フレームワークを提案する。オプションを連続的潜在変数としてモデル化し、軌道尤度の時間的因子分解を用いることで、意味的に明確で再利用可能なスキルを発見し、効率的な階層的制御を可能にするとともに、シミュレーション上の下流の操作タスクでベースラインを上回る性能を発揮する。

ABSTRACT

In this paper, we address the discovery of robotic options from demonstrations in an unsupervised manner. Specifically, we present a framework to jointly learn low-level control policies and higher-level policies of how to use them from demonstrations of a robot performing various tasks. By representing options as continuous latent variables, we frame the problem of learning these options as latent variable inference. We then present a temporal formulation of variational inference based on a temporal factorization of trajectory likelihoods,that allows us to infer options in an unsupervised manner. We demonstrate the ability of our framework to learn such options across three robotic demonstration datasets.

研究の動機と目的

  • 区切りのないデモデータから人為的アノテーションや固定されたセグメンテーションを必要とせずに、再利用可能なロボットオプションを教師なしで発見すること。
  • 低レベルの制御方策とそれらを制御する高レベルのオプション方策を統合的に学習し、階層的タスク実行を可能にすること。
  • エキスパートが提供するオプション境界や離散的オプション集合を必要とせずに、意味的で構成可能なスキルを学習する課題に対処すること。
  • 多様なデモから構造的かつ解釈可能なスキル空間を学習することで、サンプル効率を向上させるとともに、下流タスクの性能を向上させること。

提案手法

  • フレームワークはオプションを連続的潜在変数としてモデル化し、示された軌道上の潜在変数推論としてスキル発見を定式化する。
  • 時間的変分推論(TVI)目的関数を導入し、時間軸に沿った軌道尤度の因子分解に基づく。これにより、低レベルおよび高レベル方策の共同最適化が可能になる。
  • TVI目的関数は変分推論により最適化され、行動実行用の低レベル方策とオプション選択用の高レベル方策の両方が得られる。
  • 方策を表すために系列モデル(LSTMベース)を用い、人為的アノテーションされたプリミティブと整合する、分離された連続的スキル空間を学習する。
  • フレームワークはセグメンテーションなしで生デモ軌道に端末から訓練され、教師なしのスキル発見を可能にする。
  • 事前学習後、下流タスクの性能を評価するために、事前学習済み方策を強化学習でファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1人為的アノテーションされたオプション境界がなくとも、区切りのないデモデータから意味的に明確で再利用可能なロボットスキルを発見できるか?
  • RQ2統一的かつエンドツーエンドのフレームワークで、低レベルの制御方策と高レベルのオプション選択方策を同時に学習できるか?
  • RQ3オプションの連続的潜在変数表現は、離散的または固定表現アプローチと比較して、より優れた一般化性能と下流タスク性能を実現できるか?
  • RQ4時間的変分推論は、長時間スパンの軌道を効果的にモデル化し、多様なロボットデモから一貫性のあるスキル構造を推論できるか?

主な発見

  • 提案手法は、到達、把持、注ぎ口の操作といった伝統的な操作スキルに対応する連続的で意味的に明確なオプションを成功裏に発見した。これは、軌道ロールアウトの可視化による確認がなされた。
  • モデルはデモにおけるスキルの順序を正確に再構築しており、MIMEおよびRoboturkデータセットにおいて、予測されたスキル形状が真値軌道に密接に一致している。
  • フレームワークは、グリッパーの開閉といった微細な運動を捉えており、データ内の微細な運動パターンに対する感受性を示している。
  • Mocapデータセットでは、異なるエージェントの形状に対しても一般化性能が高く、元のデモのトレンドをよく再現するロールアウト軌道を生成している。
  • 6つのRobosuiteシミュレーテッドタスクにおいて、平坦な強化学習、平坦なImitation Learning、および階層的強化学習のベースラインを著しく上回り、全環境で平均報酬が高くなっている。
  • 事前学習済み方策を強化学習でファインチューニングすることで、下流タスクの性能が著しく向上した。これは、学習されたスキル空間が探索を効果的にガイドし、学習を加速させることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。