Skip to main content
QUICK REVIEW

[論文レビュー] Random Expert Distillation: Imitation Learning via Expert Policy Support Estimation

Ruohan Wang, Carlo Ciliberto|arXiv (Cornell University)|May 16, 2019
Explainable Artificial Intelligence (XAI)参考文献 27被引用数 17
ひとこと要約

この論文は、報酬関数の動的更新を回避できる固定された内在的報酬関数を生成するために、専門家方策のサポートを推定する、新しい強化学習のフレームワークであるRandom Expert Distillation(RED)を提案する。REDは、ランダムネットワーク分散とオートエンコーダーのアイデアを応用し、離散的および連続的制御タスク、特に自動運転を含むタスクにおいて、GAIL や GMMIL と同等またはそれ以上の性能を達成する。

ABSTRACT

We consider the problem of imitation learning from a finite set of expert trajectories, without access to reinforcement signals. The classical approach of extracting the expert's reward function via inverse reinforcement learning, followed by reinforcement learning is indirect and may be computationally expensive. Recent generative adversarial methods based on matching the policy distribution between the expert and the agent could be unstable during training. We propose a new framework for imitation learning by estimating the support of the expert policy to compute a fixed reward function, which allows us to re-frame imitation learning within the standard reinforcement learning setting. We demonstrate the efficacy of our reward function on both discrete and continuous domains, achieving comparable or better performance than the state of the art under different reinforcement learning algorithms.

研究の動機と目的

  • GAIL や GMMIL などの敵対的強化学習手法の不安定さと計算コストを解消すること。
  • 行動コーディングにおける誤差の累積問題を克服し、専門家軌道からロバストな報酬関数を学習すること。
  • 専門家方策のサポートを推定して固定報酬関数を定義する手法を開発し、繰り返しの報酬更新を回避すること。
  • 訓練中に強化学習信号や専門家方策へのアクセスがなくても、有限な専門家デモンストレーションから効果的な強化学習を可能にすること。
  • 特に自動運転のような高次元制御タスクにおいて、サンプル効率と一般化性能を向上させること。

提案手法

  • REDは、ランダムネットワーク分散にインspiredされたアプローチを用いて専門家方策のサポートを推定し、ランダムエンコーダーが状態を潜在表現にマップする。
  • オートエンコーダーは潜在空間内で専門家状態を再構築するように訓練され、専門家サポートのコンact表現を学習する。
  • 潜在空間における再構築誤差が固定された内在的報酬関数として用いられ、専門家サポート外の状態には低い報酬が割り当てられる。
  • 報酬関数は標準的な強化学習フレームワーク内で使用され、動的報酬適合なしに安定した訓練が可能になる。
  • 専門家サポート外の状態は「新奇」であるとみなされ、高い再構築誤差によりペナルティが与えられるというアイデアを活用する。
  • このアプローチはGAILとは直交しており、探索性とロバスト性の向上のために組み合わせて使用可能である。

実験結果

リサーチクエスチョン

  • RQ1専門家方策のサポート推定は、敵対的強化学習の安定的で効果的な代替手段となり得るか?
  • RQ2サポート推定から導かれる固定報酬関数は、動的報酬関数を上回る性能を発揮できるか?
  • RQ3サポートベースの報酬形状は、行動コーディングや逆強化学習と比較して、サンプル効率と一般化性能において優れているか?
  • RQ4自動運転のような複雑な環境において、限られた専門家デモンストレーションからREDはどの程度一般化できるか?
  • RQ5REDとGAILの組み合わせは、強化学習における探索性と訓練安定性を向上させられるか?

主な発見

  • 自動運転タスクにおいて、REDは平均エピソード報酬4825を達成し、GAIL(795)、GMMIL(2024)、BC(1033)、AE(4378)を上回った。
  • HalfCheetahおよびAnt環境では、REDは行動コーディングによる方策初期化が良好な性能を達成するために必要だったが、GAIL や GMMIL はランダム初期化からも成功した。
  • REDはランダム初期化に対してロバストであり、AE(1726)と比較して標準偏差が低い(1552)ことから、より安定した訓練が実現した。
  • REDの報酬関数は、衝突やニア・コリジョンといった危険な状態を正しくペナルティ処理し、それらの状態にほぼゼロの報酬を割り当てた。
  • GAILは過学習の問題を示し、ディスクライマの更新後に障害物を避けることができないことが多くあった。一方、GMMILは一貫性のないインcentiveを生成し、衝突の前段階に正の報酬を割り当てた。
  • REDの報酬関数は、専門家デモンストレーションとは異なる状態を効果的に特定できており、実世界の安全を重視する行動と整合的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。