Skip to main content
QUICK REVIEW

[論文レビュー] Offline Reinforcement Learning for Autonomous Driving with Safety and Exploration Enhancement

Tianyu Shi, Dong Chen|arXiv (Cornell University)|Oct 13, 2021
Autonomous Vehicle Technology and Safety参考文献 22被引用数 9
ひとこと要約

本稿では、探索の多様性を向上させるために学習可能なパラメータノイズをBCQアルゴリズムに統合し、安全な状態領域への探索を制限するリャプノフに基づく安全制約を導入することで、自律走行のための強化されたオフライン強化学習フレームワークを提案する。この手法は、高速道路および駐車シーンにおいて、最先端のオフラインRLアルゴリズムよりも優れた走行安全性と性能を達成する。

ABSTRACT

Reinforcement learning (RL) is a powerful data-driven control method that has been largely explored in autonomous driving tasks. However, conventional RL approaches learn control policies through trial-and-error interactions with the environment and therefore may cause disastrous consequences such as collisions when testing in real-world traffic. Offline RL has recently emerged as a promising framework to learn effective policies from previously-collected, static datasets without the requirement of active interactions, making it especially appealing for autonomous driving applications. Despite promising, existing offline RL algorithms such as Batch-Constrained deep Q-learning (BCQ) generally lead to rather conservative policies with limited exploration efficiency. To address such issues, this paper presents an enhanced BCQ algorithm by employing a learnable parameter noise scheme in the perturbation model to increase the diversity of observed actions. In addition, a Lyapunov-based safety enhancement strategy is incorporated to constrain the explorable state space within a safe region. Experimental results in highway and parking traffic scenarios show that our approach outperforms the conventional RL method, as well as state-of-the-art offline RL algorithms.

研究の動機と目的

  • 自律走行のための既存のオフライン強化学習(RL)アルゴリズムにおける、保守的かつ非効率的な探索の限界を解消すること。
  • 摂動モデルに学習可能なパラメータノイズを導入することで、オフラインRLにおける方策の多様性と探索効率を向上させること。
  • 状態空間の安全領域に制限されるように、リャプノフに基づく安定性制約を組み込むことで、探索中の安全性を向上させること。
  • 高速道路および駐車環境を含む現実的な自律走行シナリオにおいて、提案手法を評価すること。
  • 安全性、効率性、成功確率の観点から、標準RLおよび最先端のオフラインRLアルゴリズムに対して一貫した性能向上を示すこと。

提案手法

  • 行動制約Q学習(BCQ)アルゴリズムを拡張し、摂動モデルにおける固定ノイズを学習可能なパラメータノイズに置き換えることで、行動の多様性を向上させる。
  • 学習可能なノイズパラメータを訓練中に最適化し、状態に応じて摂動の大きさを適応的に調整することで、探索効率を向上させる。
  • 安全でない状態に至る行動をペナルティ化するリャプノフベースの安全関数を構築し、エージェントが事前に定義された安全領域内でのみ探索するように保証する。
  • リスク要因を介してリャプノフ安定性を維持する状態遷移に制限するように、安全制約をQ学習の目的関数に統合する。
  • 訓練の安定性を確保するため、経験再生とターゲットネットワークを用いて、方策およびQ関数を深層ニューラルネットワークでパラメータ化する。
  • 高速道路および駐車シーンにおいて、実世界の走行データセットを用いて実験を行い、リターン、成功確率、障害物までの最小距離、制御の滑らかさといった評価指標を用いる。

実験結果

リサーチクエスチョン

  • RQ1摂動モデルにおける学習可能なパラメータノイズは、自律走行のためのオフラインRLにおける探索の多様性と方策性能を向上させるか?
  • RQ2リャプノフに基づく安全制約は、学習効率を損なわず、探索を安全な状態領域に制限するのに有効か?
  • RQ3提案手法は、実世界の走行シナリオにおいて、標準BCQおよび他の最先端のオフラインRLアルゴリズムと比較して、安全性と性能で優れているか?
  • RQ4強化された探索と安全制約の組み合わせは、走行成功確率と快適性にどの程度の向上効果をもたらすか?
  • RQ5提案フレームワークは、高速道路や駐車場のような複雑で動的な交通環境において、より優れた一般化性とロバストネスを達成できるか?

主な発見

  • 提案手法は、高速道路および駐車シーンの両方において、標準BCQおよび最先端のオフラインRLアルゴリズムを上回り、より高い評価リターンと高速な訓練収束を達成した。
  • 摂動モデルにおける学習可能なパラメータノイズの使用により、PCAを用いた状態-行動密度プロットからも示されるように、観測された状態-行動ペアの多様性が顕著に向上した。
  • リャプノフベースの安全制約により、高速道路シナリオにおいて、周囲の車両までの最小距離が平均で5メートル以上向上した。これに対して、ノイズ付きBCQは頻繁に5メートル未満に低下していた。
  • 提案手法は、ノイズ付きBCQと比較して、より滑らかなステアリング制御と、低く、より抑制された振動を示す加速度を達成しており、快適性の向上と機械的ストレスの低減を示している。
  • 駐車シナリオにおいて、提案手法は比較対象のすべての手法の中で最高の成功確率を達成した。BCQおよびノイズ付きBCQを上回った。
  • 学習可能なノイズと安全制約の組み合わせにより、安全を確保しつつもより効果的な探索が可能となり、両者の要素に依存する手法よりもより良好なバランスが実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。