Skip to main content
QUICK REVIEW

[論文レビュー] MEGA-DAgger: Imitation Learning with Multiple Imperfect Experts

Xiatao Sun, Shuo Yang|arXiv (Cornell University)|Mar 1, 2023
Reinforcement Learning in Robotics被引用数 4
ひとこと要約

MEGA-DAgger は、複数の不完全な専門家からのインタラクティブな模倣学習のための新しい DAgger の変種であり、安全を考慮したデータフィルタによって危険なデモンストレーションを除去し、メトリクスに基づく専門家評価システムによりラベルの矛盾を解消する。この手法により、すべての個々の専門家および最先端のベースラインを上回るポリシーが学習され、自律走行において衝突回避と追い越しの両面で平均13.6%および13.2%の向上を達成する。

ABSTRACT

Imitation learning has been widely applied to various autonomous systems thanks to recent development in interactive algorithms that address covariate shift and compounding errors induced by traditional approaches like behavior cloning. However, existing interactive imitation learning methods assume access to one perfect expert. Whereas in reality, it is more likely to have multiple imperfect experts instead. In this paper, we propose MEGA-DAgger, a new DAgger variant that is suitable for interactive learning with multiple imperfect experts. First, unsafe demonstrations are filtered while aggregating the training data, so the imperfect demonstrations have little influence when training the novice policy. Next, experts are evaluated and compared on scenarios-specific metrics to resolve the conflicted labels among experts. Through experiments in autonomous racing scenarios, we demonstrate that policy learned using MEGA-DAgger can outperform both experts and policies learned using the state-of-the-art interactive imitation learning algorithms such as Human-Gated DAgger. The supplementary video can be found at \url{https://youtu.be/wPCht31MHrw}.

研究の動機と目的

  • 既存のインタラクティブな模倣学習手法が単一の完璧な専門家へのアクセスを仮定しているという制限に対処すること。
  • 各々が危険な行動や矛盾する行動を示す複数の不完全な専門家がデモンストレーションを提供する状況において、効果的な模倣学習を可能にすること。
  • インタラクティブな学習中に、危険な専門家デモンストレーションをフィルタリングし、専門家の間での行動の矛盾を解消するフレームワークを開発すること。
  • エンドツーエンドの自律走行において、安全性とパフォーマンスの両面ですべての個々の専門家を上回る初心者ポリシーを学習すること。

提案手法

  • 安全を考慮した制御バリア関数に基づく安全スコアラーを用いて、データ集約の過程で危険な専門家デモンストレーションを評価・フィルタリングする。
  • 安全スコアと進行度スコアの二重評価メカニズムを用いて、各専門家の順位付けと最良の行動選択を実施する。
  • 専門家のフィードバックを DAgger に類似したインタラクティブなループで統合し、各専門家の介入後に初心者ポリシーを再訓練する。
  • 安全閾値(実験では β = 70 ステップ)を学習することで、専門家ロールアウトからの危険なセグメントを切り詰めるデータ切断戦略を採用する。
  • 同一の観測条件下で、安全スコアと進行度スコアの合計値が最大の行動を選択することで、複数の専門家による行動の矛盾を解消する。
  • 本手法は、安全性と進行度が両方とも重要なパフォーマンス指標であるエンドツーエンドの自律走行に適用される。

実験結果

リサーチクエスチョン

  • RQ1専門家デモンストレーションに危険な行動が含まれる場合、複数の不完全な専門家を効果的に活用できるインタラクティブな模倣学習は可能か?
  • RQ2ポリシー学習中に複数の専門家による行動の矛盾をどのように解消することで、パフォーマンスの低下を避けることができるか?
  • RQ3複数の不完全な専門家からの学習によって得られるポリシーは、すべての個々の専門家を安全性およびパフォーマンスの両面で上回ることができるか?
  • RQ4危険なデモンストレーションのフィルタリングが、最終的なポリシーの安全性と一般化性能に与える影響は何か?
  • RQ5提案された専門家評価および選択メカニズムは、単純な平均化やランダム選択と比較してどのように優れているか?

主な発見

  • MEGA-DAgger は、最良の個々の専門家と比較して、平均で13.6%の衝突率低下を達成し、衝突率は 0.212 ± 0.019 にまで低下した。
  • 最良の専門家と比較して、追い越し性能は13.2%向上し、追い越し率は 0.781 ± 0.016 に達した。
  • MEGA-DAgger で学習されたポリシーは、vanilla HG-DAgger およびデータフィルタリングを施した HG-DAgger の両方を、衝突回避および追い越しの両指標で上回った。
  • 追い越しおよび衝突回避の両面で、vanilla HG-DAgger より平均45%、データフィルタリング付き HG-DAgger より15%の向上を達成した。
  • 訓練されたポリシーは、個々の専門家と比較して、試行回数にわたるパフォーマンスの標準偏差が小さく、より高い安定性を示した。
  • 可視化により、ポリシーが異なる専門家から補完的な安全な行動を学習しており、個々の専門家が共通して危険な領域として示す部分を避けることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。