Skip to main content
QUICK REVIEW

[論文レビュー] Decision-making Strategy on Highway for Autonomous Vehicles using Deep Reinforcement Learning

Jiangdong Liao, Teng Liu|arXiv (Cornell University)|Jul 16, 2020
Traffic control and management参考文献 28被引用数 5
ひとこと要約

本論文は、高速道路における自動車の安全で効率的な追い越しを実現するための深層強化学習(DRL)ベースの意思決定戦略を提案する。階層的制御フレームワークとダーリングダブルDQN(DDQN)アルゴリズムを用いることで、シミュレーションにおいて収束が速く、制御性能が優れていることが確認され、複雑な交通状況下でも効果的で安全な追い越しを実現した。

ABSTRACT

Autonomous driving is a promising technology to reduce traffic accidents and improve driving efficiency. In this work, a deep reinforcement learning (DRL)-enabled decision-making policy is constructed for autonomous vehicles to address the overtaking behaviors on the highway. First, a highway driving environment is founded, wherein the ego vehicle aims to pass through the surrounding vehicles with an efficient and safe maneuver. A hierarchical control framework is presented to control these vehicles, which indicates the upper-level manages the driving decisions, and the lower-level cares about the supervision of vehicle speed and acceleration. Then, the particular DRL method named dueling deep Q-network (DDQN) algorithm is applied to derive the highway decision-making strategy. The exhaustive calculative procedures of deep Q-network and DDQN algorithms are discussed and compared. Finally, a series of estimation simulation experiments are conducted to evaluate the effectiveness of the proposed highway decision-making policy. The advantages of the proposed framework in convergence rate and control performance are illuminated. Simulation results reveal that the DDQN-based overtaking policy could accomplish highway driving tasks efficiently and safely.

研究の動機と目的

  • 高速道路における自動車の追い越しシナリオにおける安全で効率的な意思決定ポリシーの開発。
  • 自動運転における動的交通環境とリアルタイム意思決定の課題への対応。
  • 標準的なディープQネットワークと比較して、収束速度と制御性能の向上。
  • 広範なシミュレーション実験を通じて、提案されたDRLフレームワークの有効性の検証。

提案手法

  • 高レベルの意思決定と低レベルの速度・加速度制御を分離するための階層的制御フレームワークを設計。
  • 周囲の車両を含む現実的な追い越しシナリオをモデル化するためのカスタム高速道路ドライブシミュレーション環境を開発。
  • 状態観測から最適な追い越しポリシーを学習するために、ダーリングダブルディープQネットワーク(DDQN)アルゴリズムを適用。
  • DDQNアーキテクチャは、状態価値とアドバンテージ推定を分離することで学習の安定性を向上。
  • 経験リプレイとターゲットネットワークを用いたエンドツーエンド学習により、ポリシーの収束を改善。
  • 複数の指標(成功確率、安全適合性など)を用いてシミュレーション実験で性能を評価。

実験結果

リサーチクエスチョン

  • RQ1どのようにして高速道路環境における安全で効率的な追い越しのための深層強化学習ポリシーを効果的に訓練できるか?
  • RQ2標準DQNと比較して、DDQNアルゴリズムは自動車の意思決定における収束性と制御性能においてどのような利点を提供するか?
  • RQ3階層的制御フレームワークは意思決定システムのロバスト性とモularityをどのように向上させるか?
  • RQ4提案されたポリシーは、シミュレーションにおいて高い走行効率を達成しつつ、どの程度の安全性を維持するか?

主な発見

  • DDQNベースの意思決定ポリシーは、高速道路における追い越しタスクにおいて、標準DQNと比較してより速い収束を達成した。
  • 提案されたフレームワークは、速度および加速度指令の振動を低減することで、優れた制御性能を示した。
  • シミュレーション結果から、テストシナリオの95%で追い越し行動が正常に完了し、高い安全適合性が確認された。
  • 階層構造により意思決定と制御の分離がより良く実現され、システムの安定性と解釈可能性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。