Skip to main content
QUICK REVIEW

[論文レビュー] Guided Policy Search Model-based Reinforcement Learning for Urban Autonomous Driving

Zhuo Xu, Jianyu Chen|arXiv (Cornell University)|May 6, 2020
Transportation and Mobility Innovations参考文献 21被引用数 8
ひとこと要約

本稿では、都市部の自動運転におけるサンプル効率とロバスト性を向上させるために、ガイドドポリシー探索(GPS)を用いたモデルベース強化学習手法を提案する。環境ダイナミクスのガウス・ミクスチャーモデル(GMM)を学習し、制約付き二重勾配降下を用いてポリシーを最適化することで、SACのようなモデルフリー手法と比較して100倍高いサンプル効率を達成。障害物回避やレーン変更といった複雑なタスクのポリシー学習に成功しており、ベースライン手法が失敗する問題に対しても有効である。

ABSTRACT

In this paper, we continue our prior work on using imitation learning (IL) and model free reinforcement learning (RL) to learn driving policies for autonomous driving in urban scenarios, by introducing a model based RL method to drive the autonomous vehicle in the Carla urban driving simulator. Although IL and model free RL methods have been proved to be capable of solving lots of challenging tasks, including playing video games, robots, and, in our prior work, urban driving, the low sample efficiency of such methods greatly limits their applications on actual autonomous driving. In this work, we developed a model based RL algorithm of guided policy search (GPS) for urban driving tasks. The algorithm iteratively learns a parameterized dynamic model to approximate the complex and interactive driving task, and optimizes the driving policy under the nonlinear approximate dynamic model. As a model based RL approach, when applied in urban autonomous driving, the GPS has the advantages of higher sample efficiency, better interpretability, and greater stability. We provide extensive experiments validating the effectiveness of the proposed method to learn robust driving policy for urban driving in Carla. We also compare the proposed method with other policy search and model free RL baselines, showing 100x better sample efficiency of the GPS based RL method, and also that the GPS based method can learn policies for harder tasks that the baseline methods can hardly learn.

研究の動機と目的

  • 都市部の自動運転におけるアノテーション学習やモデルフリー強化学習の低サンプル効率と低い一般化性能を改善すること。
  • 高次元かつ相互作用的な都市ドライブ環境におけるポリシー学習の安定性と解釈可能性を向上させること。
  • ベースライン手法が困難である障害物回避やアクティブレーン変更などの複雑なドライブ行動の学習を可能にすること。
  • 学習されたダイナミクスを活用した効率的でロバストなポリシー最適化を実現するモデルベースアプローチを開発すること。
  • シミュレーションにおいて最先端のモデルフリーおよびポリシー探索ベースラインと比較して、優れたパフォーマンスとサンプル効率を示すこと。

提案手法

  • 本手法は、複雑な都市ドライブダイナミクスを近似するためにガウス・ミクスチャーモデル(GMM)を用いてパラメータ化された動的モデルを繰り返し学習するガイドドポリシー探索(GPS)フレームワークを採用する。
  • 制約付きポリシー最適化問題を解くために二重勾配降下が適用され、軌道変化の大きさに制約を課すことで安定性と収束性を確保する。
  • GMMに基づく環境モデルを用いてポリシー学習をガイドすることで、エンドツーエンドのモデルフリー手法と比較して、より優れた一般化性能と解釈可能性を実現する。
  • 探索を促進するために、高分散のPDコントローラーを用いてポリシーを初期化するが、モデルフリーのベースラインはランダムなニューラルネットワーク初期化を用いる。
  • モデルベース計画とポリシー探索を組み合わせることで、Carlaシミュレータとの効率的な相互作用が可能となり、収束が迅速化する。
  • 本手法は、障害物なしおよび障害物ありの都市ドライブタスク、特にレーン変更や追越しへのタスクで評価されている。

実験結果

リサーチクエスチョン

  • RQ1モデルフリー手法と比較して、モデルベース強化学習アプローチは、都市部の自動運転ポリシー学習におけるサンプル効率を著しく向上させることができるか?
  • RQ2GPSに基づく手法は、モデルフリーおよびポリシー探索ベースラインが困難とするアクティブレーン変更や障害物回避といった複雑なタスクのロバストなドライブポリシーを学習できるか?
  • RQ3GMMに基づく動的モデルの解釈可能性と安定性は、実世界へのポリシー移行性をどのように向上させるか?
  • RQ4GPSにおける制約付きポリシー最適化は、非制約またはヒューリスティックなポリシー探索手法と比較して、収束性とパフォーマンスをどの程度向上させるか?
  • RQ5モデルベースアプローチは、都市環境における多様な初期条件やドライブシナリオに一般化できるか?

主な発見

  • GPSベースの手法は、約1,000回の環境相互作用ステップ(100秒のドライブに相当)で収束を達成し、モデルフリーのSAC手法(収束に100,000ステップ以上を要)と比較して100倍高いサンプル効率を示した。
  • GPSポリシーは最終的に約-100,000の報酬に到達し、CEM手法(約-200,000の報酬)を著しく上回った。CEM手法は不安定なステアリングと時折の衝突を示した。
  • GPS手法は、障害物車両を追越すために必要なアクティブレーン変更といった高レベル意思決定タスクのロバストなポリシーを学習に成功した。これは、CEM、IL、およびモデルフリーRLが過去および現在の実験で達成できなかったタスクである。
  • GPSベースのポリシーは安定したレーンキープ行動と効果的な追越しが可能であったが、CEMベースのポリシーは不快なステアリングと頻繁なレーンオフまたは衝突行動を示した。
  • 障害物なしおよび障害物ありの両方のドライブタスクにおいて、CEMおよびSACと比較して、モデルベースアプローチはより速い収束と高い最終的パフォーマンスを示した。
  • GMMに基づく動的モデルは、解釈可能で安定したダイナミクスを提供し、実世界への適用や迅速な適応・移行性を支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。