Skip to main content
QUICK REVIEW

[論文レビュー] Decision-making for Autonomous Vehicles on Highway: Deep Reinforcement Learning with Continuous Action Horizon

Chen, Hao, Hong Wang|arXiv (Cornell University)|Aug 26, 2020
Autonomous Vehicle Technology and Safety参考文献 28被引用数 8
ひとこと要約

本稿は、連続的アクション時間軸を持つ高速道路における自動運転車両の意思決定のためのPPO強化された深層強化学習(DRL)フレームワークを提案する。プロキシマルポリシー最適化(PPO)を活用することで、サンプル効率と学習安定性を向上させ、安全で効率的かつ適応的な車線変更および追従走行行動を実現した。本手法は、多様な走行シナリオにおいて高い最適性と頑健性を示し、優れた性能を発揮した。

ABSTRACT

Decision-making strategy for autonomous vehicles de-scribes a sequence of driving maneuvers to achieve a certain navigational mission. This paper utilizes the deep reinforcement learning (DRL) method to address the continuous-horizon decision-making problem on the highway. First, the vehicle kinematics and driving scenario on the freeway are introduced. The running objective of the ego automated vehicle is to execute an efficient and smooth policy without collision. Then, the particular algorithm named proximal policy optimization (PPO)-enhanced DRL is illustrated. To overcome the challenges in tardy training efficiency and sample inefficiency, this applied algorithm could realize high learning efficiency and excellent control performance. Finally, the PPO-DRL-based decision-making strategy is estimated from multiple perspectives, including the optimality, learning efficiency, and adaptability. Its potential for online application is discussed by applying it to similar driving scenarios.

研究の動機と目的

  • 高速道路における自動運転車両の安全で効率的かつ頑健な意思決定ポリシーの開発を目的とする。
  • 自動運転のDRLベース意思決定におけるサンプル非効率性と収束の遅さを解決することを目的とする。
  • 連続的アクション空間におけるプロキシマルポリシー最適化(PPO)を用いて、学習安定性と制御性能を向上させることを目的とする。
  • さまざまな高速道路シナリオにおいて、ポリシーの最適性、学習効率、適応性を評価することを目的とする。
  • オンライン展開および新しい走行環境への一般化の可能性を検討することを目的とする。

提案手法

  • 研究では、高速道路走行環境を連続的アクション空間を有する部分的に観測可能なマルコフ意思決定過程(POMDP)としてモデル化する。
  • プロキシマルポリシー最適化(PPO)を用いて深層ニューラルネットワークポリシーを訓練し、加速度およびステアリング指令を直接出力する。
  • PPOアルゴリズムは、学習を安定化させ、大きなポリシー更新を防ぐために信頼領域を強制する。
  • フレームワークは自転車モデルを用いて車両運動学を統合し、現実的な交通動態を組み込む。
  • 報酬形状には、衝突回避、速度追従、車線好ましさ、および操作の滑らかさの項が含まれる。
  • 本手法は、車線数や周囲の車両密度が異なる複数の走行シナリオを通じてシミュレーションによって評価された。

実験結果

リサーチクエスチョン

  • RQ1PPO-DRLは、連続的アクション空間における高速道路意思決定において、どのように学習効率とサンプル効率を向上させるか?
  • RQ2学習済みポリシーは、異なる車線構成や車両密度を持つ新しい走行シナリオにどの程度一般化可能か?
  • RQ3ベースラインDRL手法と比較して、ポリシーの最適性、安全性、収束速度の観点でどのように性能を発揮するか?
  • RQ4高密度交通や遮蔽状態の交通条件下で、ポリシーの適応性に影響を与える要因は何か?
  • RQ5ポリシーはオンラインまたはリアルタイム走行シナリオに効果的に適用可能か?

主な発見

  • PPO-DRLポリシーは、標準的なDRLベースラインと比較して優れた学習効率とより速い収束を達成した。
  • シナリオ1(追加の車線あり)では、改善された車線変更機会のおかげで、平均報酬が高くなった。
  • シナリオ2(車両が多く、車線が少ない)では、複雑な交通状況の中でも衝突を回避することで安全性を維持した。
  • シナリオ1のエピソード5では、すべての車線が閉鎖されていたため、車両追従走行を活用して衝突を回避したポリシーの適応性が示された。
  • シナリオ2のエピソード6では、危険な追い越し操作が発生し、衝突に至った。これは、延長されたトレーニングまたは通信統合の必要性を示唆している。
  • ポリシーは、新しいシナリオにおいても強力な一般化能力を示し、動的環境への頑健性と適応性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。