Skip to main content
QUICK REVIEW

[論文レビュー] Human-like Decision Making for Autonomous Driving via Adversarial Inverse Reinforcement Learning

Pin Wang, Dapeng Liu|arXiv (Cornell University)|Nov 19, 2019
Reinforcement Learning in Robotics参考文献 15被引用数 12
ひとこと要約

本稿では、自律走行車両の政策学習および報酬回復を向上させるために、意味的報酬項を統合した拡張された敵対的逆強化学習(AIRL)フレームワークを提案する。複雑で相互作用的な走行状況において安定性と性能を向上させることで、人間の運転行動に類似した意思決定を実現し、シミュレーション上での強化学習(RL)および模倣学習(IL)のベースラインを上回る性能を達成する。

ABSTRACT

To make human-like decisions under complex driving environment is a challenging task for autonomous agents. Imitation Learning or learning-from-demonstration methods have seen great potential for achieving such a goal. Some state-of-the-art studies apply Generative Adversarial Imitation Learning (GAIL) to learn sequential decision-making and control policies. While GAIL can directly learn a policy, it lacks the ability to recover a reward function, which is considered robust and adaptable to environments changes. Adversarial Inverse Reinforcement Learning (AIRL) is another learning-from-demonstration method that can achieve similar benefits as GAIL but also learns the reward function with the policy simultaneously. In the original work of AIRL, it has been demonstrated in single-agent environments such as maze navigation and ant running tasks in OpenAI Gyms. In this paper, we augment AIRL by concatenating semantic reward terms in the learning framework to improve and stabilize its performance, and then extend it to a more practical but challenging situation, i.e. decision-making scenario in highly interactive driving environment. Four performance evaluation metrics are proposed and compared with some Imitation Learning based methods and Reinforcement Learning based methods. Simulation results show that the augmented AIRL outperforms all the other methods, and the trained vehicle agent can perform decision-making behaviors comparable with that of the experts.

研究の動機と目的

  • 高度に相互作用的な走行環境において、自律走行車両が人間の運転行動に類似した意思決定をとれるようにすること。
  • 既存の模倣学習手法が解釈可能で柔軟な報酬関数を回復できないという限界を解決すること。
  • 意味的報酬項の統合によって、敵対的逆強化学習(AIRL)の安定性と性能を向上させること。
  • AIRLを単純な環境から、複数のエージェントと動的相互作用を含む現実的で複雑な走行状況へと拡張すること。
  • 包括的な指標を用いて、シミュレーションフレームワーク内で最先端のIRLおよびRLベースラインと比較して、提案手法の有効性を評価すること。

提案手法

  • 訓練中に、車線維持、速度の一貫性、衝突回避などの意味的報酬項を報酬関数に連結することで、元のAIRLフレームワークを拡張する。
  • これらの意味的項を報酬関数の補助的要素として統合し、政策学習をガイドするとともに、訓練のダイナミクスを安定化させる。
  • 生成的敵対的フレームワークを用い、識別器が専門家のデモンストレーションと専門家が生成したロールアウトを区別する一方で、エージェントは専門家の行動を模倣する方策を学習する。
  • 敵対的訓練を用いて、同時に政策と報酬関数を最適化することで、両者のエンドツーエンド学習を可能にする。
  • 複数の車両と動的障害物を含む、複雑で相互作用的な交通状況をモデル化した高精細なシミュレーション環境でエージェントを訓練する。
  • 4つの性能指標を用いたマルチオブジェクティブ評価フレームワークを適用し、提案手法とベースラインのIRLおよびRLアプローチを比較する。

実験結果

リサーチクエスチョン

  • RQ1意味的報酬項の統合は、複雑な自律走行状況におけるAIRLの安定性と性能を向上させるか?
  • RQ2拡張されたAIRL手法は、意思決定の質と安全性の観点から、既存の模倣学習および強化学習ベースラインと比較してどのように異なるか?
  • RQ3学習された方策は、相互作用的で混雑した交通環境において、専門家の人間の運転行動をどの程度再現できるか?
  • RQ4環境の変化や動的交通状況下でも、回復された報酬関数は堅牢で解釈可能であるか?
  • RQ5意味的報酬成分は、方策ネットワークの収束性および一般化性能にどのような影響を及えるか?

主な発見

  • 拡張されたAIRL手法は、シミュレーション環境において、比較されたすべての模倣学習および強化学習ベースラインを上回る性能を示した。
  • 訓練された車両エージェントは、複雑で相互作用的な交通状況において、専門家の人間ドライバーと同等の意思決定行動を示した。
  • 意味的報酬項の統合により、AIRLフレームワークの訓練の安定性と収束速度が顕著に向上した。
  • 本手法は、人間の運転の好みと安全基準に一致する構造的かつ解釈可能な報酬関数を効果的に回復できた。
  • 提案された4つの評価指標は、複数の走行状況において一貫して拡張AIRLを最良の性能を持つ手法として評価した。
  • 回復された報酬関数は、未観測の交通状況に対しても良好に一般化され、環境変動に対する堅牢性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。