Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Reinforcement Learning Method for Autonomous Vehicle Behavior Planning

Zhiqian Qiao, Zachariah Tyree|arXiv (Cornell University)|Nov 9, 2019
Reinforcement Learning in Robotics参考文献 23被引用数 7
ひとこと要約

本稿は、前方車両を追従するや停止サインで停止するといった複数のサブゴールを、モジュラーでアテンションベースのアーキテクチャを用いて効率的に学習できる、自律走行車両の行動計画のための階層的強化学習(HRL)フレームワークを提案する。本手法はハイブリッド報酬メカニズムと階層的優先順位付き経験再生を用い、従来のRLと比較して収束が速く、サンプル効率が向上しており、タスク間で再利用可能なサブポリシー・モジュールを備えている。

ABSTRACT

In this work, we propose a hierarchical reinforcement learning (HRL) structure which is capable of performing autonomous vehicle planning tasks in simulated environments with multiple sub-goals. In this hierarchical structure, the network is capable of 1) learning one task with multiple sub-goals simultaneously; 2) extracting attentions of states according to changing sub-goals during the learning process; 3) reusing the well-trained network of sub-goals for other similar tasks with the same sub-goals. The states are defined as processed observations which are transmitted from the perception system of the autonomous vehicle. A hybrid reward mechanism is designed for different hierarchical layers in the proposed HRL structure. Compared to traditional RL methods, our algorithm is more sample-efficient since its modular design allows reusing the policies of sub-goals across similar tasks. The results show that the proposed method converges to an optimal policy faster than traditional RL methods.

研究の動機と目的

  • 従来の強化学習が複数のサブゴールを扱う際の限界、特に収束が遅く、サンプル効率が低いという点を是正すること。
  • 前方車両を追従するや停止サインで停止するといった、明確に区別できるドライブ行動をモジュラーに学習できる階層的深層強化学習構造を開発すること。
  • 共通の階層的フレームワーク内でのサブゴールポリシーの分離により、類似したタスク間で訓練済みポリシーの再利用を可能にすること。
  • 意思決定の階層的レベルに応じて効果的に性能を評価できるハイブリッド報酬メカニズムを設計すること。
  • HRLに特化した階層的優先順位付き経験再生メカニズムを用いて、学習の安定性と効率を向上させること。

提案手法

  • フレームワークは二段階のHRL構造を採用:上位レベルのオプションネットワークがサブゴール(例:停止サインで停止、前方車両を追従)を選択し、下位レベルのポリシーが選択されたオプションに基づいて行動を実行する。
  • 状態アテンションメカニズムが、現在のサブゴールに応じて、前方車両までの距離や停止サインまでの距離といった関連状態特徴の間で注目を動的にシフトする。
  • ハイブリッド報酬関数は、下位レベルで密な形状報酬を、上位レベルで疎でタスク固有の報酬を組み合わせ、階層的意思決定レイヤー全体での学習を導く。
  • 階層的優先順位付き経験再生(H-PER)メカニズムにより、上位および下位レベルのポリシー更新に最も有益な遷移を優先的に処理することで、サンプル効率を向上させる。
  • ポリシー学習には深層Qネットワーク(DQNおよびDDQN)を用い、行動レベルポリシー(例:前方車両を追従)とオプションレベルポリシー(例:停止または追従の選択)を別々に訓練する。
  • アーキテクチャはモジュラーなデプロイメントを可能にし、訓練済みサブポリシー(例:前方車両を追従)を、フルシステムの再訓練なしに新しいタスクで再利用可能である。

実験結果

リサーチクエスチョン

  • RQ1階層的強化学習フレームワークは、停止サインで停止するや前方車両を追従するといった複数の自律走行車両行動サブゴールを、一度の統合的訓練プロセス内で効果的に学習できるか?
  • RQ2状態アテンションメカニズムの統合は、動的ドライブシナリオにおけるポリシーの汎化性と適応性をどのように向上させるか?
  • RQ3ハイブリッド報酬メカニズムは、標準的な密報酬または疎報酬関数と比較して、学習効率と収束速度をどの程度向上させるか?
  • RQ4提案されたHRLフレームワークは、複雑なドライブ環境において、従来の深層強化学習よりも優れたサンプル効率とより速い収束を達成できるか?
  • RQ5訓練済みサブポリシーは、どの程度異なるタスク間で再利用可能であり、自律走行車両におけるモジュラーかつスケーラブルな行動計画を可能にするか?

主な発見

  • 提案されたハイブリッドHRL手法は、従来の強化学習手法と比較して、より速い収束を達成した。トレーニング曲線から、性能向上が迅速に観察された。
  • 階層的優先順位付き経験再生(H-PER)メカニズムは、高いパフォーマンスに到達するまでの訓練ステップ数を顕著に削減し、サンプル効率を大幅に向上させた。
  • アテンションメカニズムは、現在のサブゴールに応じて、前方車両までの距離や停止サインまでの距離といった状態特徴の注目を動的に適応させることに成功し、ポリシーのロバスト性を向上させた。
  • 前方車両を追従するポリシー(FFV)はテストで98%の成功確率を達成した。一方、停止線ポリシー(SSL)は95%の成功確率を達成し、孤立したタスクにおいて高い信頼性を示した。
  • オプションレベルポリシー(環境状態に応じてFFVとSSLの選択を学習)は、複雑な交差点シナリオで92%の成功確率を達成し、手動で設計されたルールベースシステムを上回った。
  • モジュラー設計により、FFVポリシーが再訓練なしに新しいタスクで再利用可能であることが確認され、フレームワークのスケーラビリティとタスク間移行性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。