Skip to main content
QUICK REVIEW

[論文レビュー] Compositional Imitation Learning: Explaining and executing one task at a time

Thomas Kipf, Yujia Li|arXiv (Cornell University)|Dec 4, 2018
Topic Modeling参考文献 9被引用数 7
ひとこと要約

CompILEは、教師なしで微分可能な系列分割モジュールを用いて、示範データから再利用可能な可変長の行動セグメントを発見する構成的模倣学習フレームワークを提案する。自己符号化により訓練されるため、スパarsな報酬環境下でも階層的な実行が可能となり、学習済みの潜在コードからタスク固有のポリシーを学習することで、非階層的エージェントを上回る性能を発揮する。

ABSTRACT

We introduce a framework for Compositional Imitation Learning and Execution (CompILE) of hierarchically-structured behavior. CompILE learns reusable, variable-length segments of behavior from demonstration data using a novel unsupervised, fully-differentiable sequence segmentation module. These learned behaviors can then be re-composed and executed to perform new tasks. At training time, CompILE auto-encodes observed behavior into a sequence of latent codes, each corresponding to a variable-length segment in the input sequence. Once trained, our model generalizes to sequences of longer length and from environment instances not seen during training. We evaluate our model in a challenging 2D multi-task environment and show that CompILE can find correct task boundaries and event encodings in an unsupervised manner without requiring annotated demonstration data. Latent codes and associated behavior policies discovered by CompILE can be used by a hierarchical agent, where the high-level policy selects actions in the latent code space, and the low-level, task-specific policies are simply the learned decoders. We found that our agent could learn given only sparse rewards, where agents without task-specific policies struggle.

研究の動機と目的

  • 教師なしのタスクアノテーションを用いて、未構造化な示範シーケンスから再利用可能な行動セグメントを発見すること。
  • 示範データ内の可変長行動セグメントを識別する、完全に微分可能な教師なし系列分割モジュールの開発。
  • 学習済みの潜在コード表現を用いて、訓練時に見られなかった長さのシーケンスや未確認の環境への一般化を実現すること。
  • 学習済みの潜在コードをハイレベルなアクションとして用い、デコーダーをローレベルポリシーとして用いることで、階層的意思決定を支援すること。
  • 学習済みの行動から導出されるタスク固有のポリシーを活用することで、スパars報酬設定におけるサンプル効率を向上させること。

提案手法

  • 示範シーケンスを潜在コードの系列に符号化するための系列オートエンコーダアーキテクチャを用いる。各潜在コードは可変長の行動セグメントを表す。
  • 教師なしで、意味のある行動ユニットにシーケンスを分割できる、新規の完全に微分可能なモジュールを用いて系列の分割を実行する。
  • 各潜在コードは、コードからローレベルの行動シーケンスにマップするデコーダー・ポリシーに関連付けられる。これにより、学習済みの行動の実行が可能になる。
  • ハイレベルポリシーは潜在コード空間で動作し、新しいタスクシーケンスを構成するコードを選択する。
  • 入力シーケンスの忠実度を保持しつつ、分離可能で再利用可能な行動を学習するため、再構成損失を用いてエンド・トゥ・エンドでモデルを訓練する。
  • 学習済みの潜在コードの構成的性質とそれらに関連するポリシーを用いることで、訓練時に見られなかった長さのシーケンスや未確認の環境への一般化が達成される。

実験結果

リサーチクエスチョン

  • RQ1教師なしで微分可能な系列分割モジュールは、構造のない示範シーケンスから意味のある再利用可能な行動セグメントを発見できるか?
  • RQ2学習済みの潜在コードと関連するポリシーは、新しい長時間のシーケンスや未確認のタスクの階層的実行を効果的に可能にするか?
  • RQ3学習済みのデコーダーを備えた階層的エージェントアーキテクチャは、スパars報酬環境下でサンプル効率を向上させるか?
  • RQ4アノテートされたデータが存在しない状況でも、モデルは正しいタスク境界とイベント符号化をどれほど正しく特定できるか?
  • RQ5モデルは、訓練時に見られなかった環境やシーケンス長に対して、どの程度一般化できるか?

主な発見

  • CompILEは、アノテートされた示範データを一切必要とせず、教師なしでタスク境界とイベント符号化を正しく発見する。
  • モデルは、訓練時に見られなかった長さのシーケンスにも一般化でき、構成的一般化を示している。
  • 学習済みのデコーダーを備えた階層的エージェントは、タスク固有のポリシーを持たないエージェントよりも、スパars報酬環境下で優れた性能を発揮する。
  • 学習済みの潜在コードは再利用可能な可変長の行動セグメントを表しており、これらを再結合することで新しいタスクシーケンスを構成できる。
  • 完全に微分可能な分割モジュールにより、エンド・トゥ・エンドの訓練が可能になり、生のシーケンスから安定した行動コンponentsの発見が可能になる。
  • 潜在コード空間を介して学習済みの行動を組み合わせることで、未確認の環境への効果的なゼロショット転送がフレームワークによって可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。