Skip to main content
QUICK REVIEW

[論文レビュー] Imitation Learning from Imperfect Demonstration

Yueh-Hua Wu, Nontawat Charoenphakdee|arXiv (Cornell University)|Jan 27, 2019
Adversarial Robustness in Machine Learning参考文献 43被引用数 16
ひとこと要約

本稿では、不完全な示範データの信頼度スコアを活用してポリシー学習を改善する2つの新規模倣学習手法—2IWILとIC-GAIL—を提案する。信頼度スコアを用いた軌道の再重み付けとラベルなしデータの利用により、両手法ともベースラインを著しく上回る性能を示し、IC-GAILは収束が遅いものの優れた性能を発揮する。また、最適な示範データが高コストで入手困難な現実世界の設定において、信頼度スコアのノイズに強く、ロバストであることが示された。

ABSTRACT

Imitation learning (IL) aims to learn an optimal policy from demonstrations. However, such demonstrations are often imperfect since collecting optimal ones is costly. To effectively learn from imperfect demonstrations, we propose a novel approach that utilizes confidence scores, which describe the quality of demonstrations. More specifically, we propose two confidence-based IL methods, namely two-step importance weighting IL (2IWIL) and generative adversarial IL with imperfect demonstration and confidence (IC-GAIL). We show that confidence scores given only to a small portion of sub-optimal demonstrations significantly improve the performance of IL both theoretically and empirically.

研究の動機と目的

  • 最適なポリシーを学習する課題に取り組む。これは、最適なエキスパートデータの収集に高コストがかかるため、現実世界の応用で一般的な不完全な示範データの状況を想定する。
  • 完全に最適な軌道に依存しない、実用的な模倣学習フレームワークを構築する。これにより、ラベル付きの信頼度スコアとラベルなしの示範データを効果的に活用する。
  • 信頼度を示範品質の代理指標として組み込むことで、一般化性能とロバスト性を向上させ、特に信頼度がラベル付きの示範データの少数に限られる状況で有効である。
  • 標準的なGAILや行動コーディングと比較して、信頼度に基づく再重み付けと混合分布モデリングが、限られたラベル付きデータでも優れた性能を発揮することを検証する。

提案手法

  • 2IWILは、ラベルなしの示範データの信頼度スコアを予測するための経験的リスク最小化を用い、推定された信頼度に基づいて軌道を再重み付けする。その後、再重み付けされたデータでGAILの目的関数を最適化する。
  • この手法は、ラベル付きデータとラベルなしデータを係数βで統合することで、分散を最小化するリスク推定器を定式化し、限られた信頼度アノテーションを効率的に活用できる。
  • IC-GAILは、示範の混合分布を最適と非最適な分布の組み合わせとしてモデル化し、非最適成分に再重み付けを施しながら、敵対的訓練により最適な占有測度を一致させる。
  • これは、混合分布における最適示範の割合に依存するGANベースの目的関数を導出し、信頼度アノテーション付きとラベルなしの軌道の両方からディスクラミネーターが学習できるようにする。
  • 両手法は汎用的かつ拡張可能であり、GAILなどの既存のIRLおよびILフレームワークと互換性があり、異なる損失関数、モデル、最適化手法に対応可能である。
  • このフレームワークは、信頼度スコアが一部の示範データにのみ利用可能であると仮定しており、完全なエキスパートラベル付けが現実的に不可能な状況において実用的である。

実験結果

リサーチクエスチョン

  • RQ1限られた数の不完全な示範データに対して信頼度スコアが与えられた場合、標準的手法が最適な示範データを仮定するのと比較して、模倣学習の性能が著しく向上するか?
  • RQ2信頼度アノテーション付きデータに加えてラベルなしの示範データを活用することで、ポリシー学習の性能とサンプル効率にどのような影響を与えるか?
  • RQ3現実世界の設定において、人間のラベルラーが提供するノイズや不正確な信頼度スコアに対しても、提案手法はロバストか?
  • RQ4限られた信頼度データの下で、2IWILとIC-GAILの間のトレードオフは、学習速度と最終的な性能の観点でどのように現れるか?
  • RQ5IC-GAILの混合分布モデリングは、最適示範の割合が低い状況でも、最適ポリシーを効果的に回復できるか?

主な発見

  • IC-GAILは、4つのベンチマーク環境すべてで、標準GAILや再重み付け付きGAILを含むすべてのベースラインを上回り、収束が遅いものの、平均報酬がより高い。
  • 2IWILは収束が早く、特にAnt-v2やWalker2d-v2のような信頼度情報が乏しいタスクで優れた性能を発揮する。
  • 同じ総数の示範データを使用しても、信頼度を無視するGAIL (U+C) よりも、提案手法は著しく優れた性能を示し、信頼度アノテーションの価値を裏付けた。
  • 2IWILとIC-GAILの両方とも、信頼度スコアにガウスノイズが加わっても高い性能を維持し、ラベルラーが一貫性のないまたは不正確な信頼度を提供してもロバストであることが確認された。
  • ラベルなしの示範データの数が増えるほど性能が向上し、信頼度データが限られる状況でも、ラベルなしデータがポリシー学習に正の貢献することが確認された。
  • HalfCheetah-v2では、標準GAILのディスクラミネーターが局所最適に陥るが、本手法の信頼度ベース再重み付けにより、この問題が緩和された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。