Skip to main content
QUICK REVIEW

[論文レビュー] VILD: Variational Imitation Learning with Diverse-quality Demonstrations

Voot Tangkaratt, Bo Han|arXiv (Cornell University)|Sep 15, 2019
Reinforcement Learning in Robotics参考文献 49被引用数 4
ひとこと要約

VILDは、確率的グラフィカルモデルを用いて教師の熟練度をモデル化する変分模倣学習手法を提案する。これにより、教師の質に関する事前知識がなくても、多様な品質の示範データから頑健なポリシー学習が可能になる。変分推論と重要度サンプリングを組み合わせることで、VILDは連続制御ベンチマークで最先端の性能を達成し、現実的なIL設定におけるスケーラビリティとデータ効率性を示している。

ABSTRACT

The goal of imitation learning (IL) is to learn a good policy from high-quality demonstrations. However, the quality of demonstrations in reality can be diverse, since it is easier and cheaper to collect demonstrations from a mix of experts and amateurs. IL in such situations can be challenging, especially when the level of demonstrators' expertise is unknown. We propose a new IL method called \underline{v}ariational \underline{i}mitation \underline{l}earning with \underline{d}iverse-quality demonstrations (VILD), where we explicitly model the level of demonstrators' expertise with a probabilistic graphical model and estimate it along with a reward function. We show that a naive approach to estimation is not suitable to large state and action spaces, and fix its issues by using a variational approach which can be easily implemented using existing reinforcement learning methods. Experiments on continuous-control benchmarks demonstrate that VILD outperforms state-of-the-art methods. Our work enables scalable and data-efficient IL under more realistic settings than before.

研究の動機と目的

  • 示範データの品質がばらつき、かつ熟練度が事前に不明な状況における模倣学習の課題に対処すること。
  • 低品質および高品質の示範データから、教師の熟練度と報酬関数を同時に推定できるスケーラブルな手法を開発すること。
  • 熟練度を確率的フレームワーク内の潜在変数としてモデル化することで、データ効率性と頑健性を向上させ、模倣学習を改善すること。
  • 高品質な教師示範データが不足または入手困難な現実世界のシナリオにおいて、ILの実用的導入を可能にすること。

提案手法

  • VILDは、教師の熟練度を潜在変数として確率的グラフィカルモデルでモデル化し、熟練度と報酬関数の同時推定を可能にする。
  • 計算が困難な熟練度とポリシーの後確率分布の近似のため、変分推論アプローチを採用することで、大規模な状態空間および行動空間へのスケーラビリティを実現する。
  • 示範データと推定熟練度レベルの同時尤度を最適化するために、変分下界(ELBO)を用いる。
  • 推定熟練度に基づいて軌道を再重み付けするため、重要度サンプリングを適用し、ポリシー学習中のデータ効率性を向上させる。
  • 標準的な強化学習アルゴリズムを用いてフレームワークを実装し、ディープRL手法との統合を可能にする。
  • 報酬関数はポリシーと熟練度推定と同時にエンドツーエンドで学習され、混合品質のデータから学習可能になる。

実験結果

リサーチクエスチョン

  • RQ1真のラベルや追加の教師信号が存在しない状況でも、確率的モデルが教師の潜在的熟練度を効果的に推定できるか?
  • RQ2変分推論を活用することで、多様な品質の示範データを伴う高次元連続制御タスクへの模倣学習をどの程度スケーラブルに拡張できるか?
  • RQ3推定熟練度に基づく重要度サンプリングは、模倣学習におけるデータ効率性をどの程度向上させるか?
  • RQ4混合品質の示範データで学習した場合、VILDはSOTA手法と比較して性能と頑健性においてどの程度優れているか?
  • RQ5報酬関数と熟練度レベルの同時推定は、固定された教師品質を仮定する手法よりも優れたポリシー性能を達成できるか?

主な発見

  • VILDは、低品質の軌道が顕著に含まれる場合でも、連続制御ベンチマークでSOTAの模倣学習手法を上回る性能を発揮する。
  • 学習された熟練度推定により、低品質の示範データを効果的に特定・低減することで、優れた性能を達成している。
  • ノイズが多く多様な示範データに対しても頑健性を示し、教師示範データが少ない状況でも高いポリシー性能を維持している。
  • 変分推論の統合により、高次元の状態空間および行動空間でもスケーラブルな学習が可能になり、正確な推論の制限を克服している。
  • 推定熟練度に基づく重要度サンプリングは、高品質な示範データへの依存を著しく低減し、データ効率性を顕著に向上させている。
  • 実験的結果から、報酬関数と熟練度の同時学習が、既知または固定された教師品質を仮定する手法よりも優れたポリシー最適化を実現することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。