Skip to main content
QUICK REVIEW

[論文レビュー] Decision Making for Autonomous Driving via Augmented Adversarial Inverse Reinforcement Learning

Pin Wang, Dapeng Liu|arXiv (Cornell University)|Nov 19, 2019
Reinforcement Learning in Robotics参考文献 29被引用数 6
ひとこと要約

本稿では、学習の安定化と複雑なインタラクティブな自動運転シナリオにおけるパフォーマンス向上を目的として、識別器にトレーニング可能なセマンティック報酬項を統合した、拡張型対抗的逆強化学習(AugAIRL)を提案する。Lane-changingタスクにおいて評価された結果、AugAIRLは4つの指標において専門家のデモンストレーションと同等のパフォーマンスを達成し、GAIL、AIRL、TRPO、およびBC+TRPOベースラインと比較して、トレーニングおよびテストの両フェーズで優れた性能を示した。

ABSTRACT

Making decisions in complex driving environments is a challenging task for autonomous agents. Imitation learning methods have great potentials for achieving such a goal. Adversarial Inverse Reinforcement Learning (AIRL) is one of the state-of-art imitation learning methods that can learn both a behavioral policy and a reward function simultaneously, yet it is only demonstrated in simple and static environments where no interactions are introduced. In this paper, we improve and stabilize AIRL's performance by augmenting it with semantic rewards in the learning framework. Additionally, we adapt the augmented AIRL to a more practical and challenging decision-making task in a highly interactive environment in autonomous driving. The proposed method is compared with four baselines and evaluated by four performance metrics. Simulation results show that the augmented AIRL outperforms all the baseline methods, and its performance is comparable with that of the experts on all of the four metrics.

研究の動機と目的

  • 報酬関数を手動で設計することなく、人間らしいインタラクティブな意思決定を自動運転で学ぶ課題に対処すること。
  • 動的でインタラクティブな環境における対抗的逆強化学習(AIRL)のパフォーマンスを改善および安定化すること。
  • セマンティック報酬をイミュレーション学習フレームワークに統合するための軽量で汎用性の高い手法を開発すること。
  • 高交通量でインタラクティブな条件下での現実的なlane-changing意思決定タスクに対して、この手法を評価すること。
  • 意味的に意味のある行動を有するシステムを構築し、4つの包括的な評価指標を確立すること。

提案手法

  • 状態に依存するセマンティック報酬項を識別器ネットワークに連結することで、AIRLフレームワークを拡張し、ポリシーと報酬学習をガイドする。
  • 報酬重みを敵対的トレーニングプロセスの一部としてエンドツーエンドで学習させ、セマンティック報酬の最適な大きさをモデルが学習可能にする。
  • 生成的敵対的フレームワークを採用し、識別器が専門家のデモンストレーションと専門家が生成した軌道を区別する一方で、報酬関数とポリシーを同時に学習する。
  • 複数の相互作用するエージェントと複雑なlane-changingシナリオを備えたシミュレーテッド自動運転環境に、拡張されたフレームワークを適応させる。
  • 順序付き意思決定をモデル化するための再帰的構造を持つポリシーネットワークを用い、専門家対エージェント軌道の区別とセマンティック報酬の監視の両方を組み込んだ識別器を採用する。
  • 総報酬、成功確率、意思決定ステップ、lane-changingステップの4つの評価指標を統合的に性能評価に用いる。

実験結果

リサーチクエスチョン

  • RQ1AIRLフレームワークにセマンティック報酬を統合することで、インタラクティブな自動運転タスクにおける学習の安定性とパフォーマンスが向上するか?
  • RQ2評価指標の観点から、AugAIRLは、イミュレーション学習および強化学習のベースライン手法と比較して、模倣の忠実性と耐性に優れているか?
  • RQ3明示的な報酬形状の調整なしに、複雑で動的なlane-changingシナリオにおいて、AugAIRLは専門家水準の行動をどれほど回復できるか?
  • RQ4セマンティック報酬の導入により、標準的なAIRLおよびGAILと比較して、収束が速く、パフォーマンスのばらつきが小さくなるか?
  • RQ5学習された報酬関数は、異なるドライブシナリオに一般化可能であり、新しい環境への適応に役立つのか?

主な発見

  • AugAIRLは、すべてのトレーニングおよびテストフェーズにおいて、最高の総報酬を達成し、専門家水準のパフォーマンスに一貫して近づいた。
  • テストにおけるAugAIRLの成功確率は1.0に達し、ほぼ完全なlane-changing完了を示しており、他の手法と比較してより速く収束した。
  • AugAIRLは意思決定ステップおよびlane-changingステップの数が最も少なく、専門家行動に類似した効率的かつ適切なマニューバーを示した。
  • すべての指標において、AugAIRLはGAIL、AIRL、TRPO、およびBC+TRPOと比較して、最も低いばらつきを示し、優れた安定性を示した。
  • トレーニングおよびテストの両方において、AugAIRLはすべてのベースラインを上回った。特にテストフェーズにおいて性能差が拡大しており、より優れた一般化性能と耐性を示した。
  • 学習曲線の形状から、エージェントは当初、慎重に行動していたが、次第にlane-changingにコミットするよう学習しており、専門家のためらいとタイミングを模倣していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。