Skip to main content
QUICK REVIEW

[論文レビュー] Anti-Jerk On-Ramp Merging Using Deep Reinforcement Learning

Yuan Lin, John McPhee|arXiv (Cornell University)|Sep 27, 2019
Traffic control and management参考文献 33被引用数 5
ひとこと要約

本論文は、乗車快適性を高めるために車両のジャerkを最小化することに注力し、衝突を回避する運用を保証する、分散型で高速な合流用の深層強化学習(DRL)手法を提案する。小さなジャerkペナルティ重み(wj = 0.00075)を用いることで、ペナルティなしのベースラインと比較してジャerkを73%低減し、衝突はゼロを維持した。

ABSTRACT

Deep Reinforcement Learning (DRL) is used here for decentralized decision-making and longitudinal control for high-speed on-ramp merging. The DRL environment state includes the states of five vehicles: the merging vehicle, along with two preceding and two following vehicles when the merging vehicle is or is projected on the main road. The control action is the acceleration of the merging vehicle. Deep Deterministic Policy Gradient (DDPG) is the DRL algorithm for training to output continuous control actions. We investigated the relationship between collision avoidance for safety and jerk minimization for passenger comfort in the multi-objective reward function by obtaining the Pareto front. We found that, with a small jerk penalty in the multi-objective reward function, the vehicle jerk could be reduced by 73% compared with no jerk penalty while the collision rate was maintained at zero. Regardless of the jerk penalty, the merging vehicle exhibited decision-making strategies such as merging ahead or behind a main-road vehicle.

研究の動機と目的

  • 高速高速道路での合流に適した分散型でリアルタイムな合流ポリシーを、深層強化学習を用いて開発すること。
  • 自動合流における、衝突回避(安全性)とジャerk最小化(乗車快適性)という相反する目的をバランスさせること。
  • 多目的報酬関数の設計を通じて、安全性と快適性のトレードオフを調査すること。
  • 得られた意思決定戦略(例:先行合流または後続合流)と、報酬設計に依存するその依存関係を評価すること。
  • DRLが最小限のジャerkでほぼ最適な合流性能を達成し、衝突率がゼロを維持できることを実証すること。

提案手法

  • DRL環境は、合流車両と、主路の前方および後方の各2台の車両を含む5台の車両をモデル化する。
  • 状態空間には、5台すべての車両の相対的位置、速度、合流地点までの距離が含まれる。
  • 行動空間は連続的であり、合流車両の加速度指令を表す。
  • 深層強化学習のための連続的制御ポリシーを学習するために、深層ニューラルネットワークを用いた、深層決定的方策勾配(DDPG)アルゴリズムが使用される。
  • 複数の目的を組み合わせた報酬関数が採用され、衝突回避(衝突に対するペナルティ)、制御効率、および重みwjを有するジャerkペナルティ項が含まれる。
  • 安全性と快適性のパレートフロントを調査するため、ジャerkペナルティ重みwjを変化させ、最適なトレードオフを特定する。

実験結果

リサーチクエスチョン

  • RQ1高速合流における衝突回避とジャerk最小化の最適なトレードオフは何か?
  • RQ2報酬関数にジャerkペナルティを組み込むことで、合流動作の滑らかさはどのように変化するか?
  • RQ3異なる報酬設定下で、DRLポリシーから生じる意思決定戦略(例:先行合流または後続合流)は何か?
  • RQ4DRLポリシーは、ジャerkペナルティなしのベースラインと比較して、衝突ゼロを維持しながら車両ジャerkを著しく低減できるか?
  • RQ5ジャerkペナルティの重みが、制御行動および全体的な合流性能にどのように影響するか?

主な発見

  • 小さなジャerkペナルティ重み(wj = 0.00075)を用いることで、ペナルティなしのベースラインと比較して、車両ジャerkは73%低減され、衝突はゼロを維持した。
  • 合流車両は主に2つの意思決定戦略を示した:後続車両の前で合流する(80%以上で発生)か、後続車両の後で合流するかのいずれかであった。
  • 先行合流が好まれたのは、それによりジャerkの大きさが低減され、合流時間の短縮と停止ペナルティの低減により、累積割引報酬が高くなったためである。
  • ジャerkペナルティが高すぎた場合(wj = 0.015)、ポリシーが十分な減速を適用できず、加速度変化の過剰ペナルティにより衝突が発生した。
  • ジャerkペナルティが存在しない場合(wj = 0)、加速度およびジャerkプロファイルは著しくノイズが多く、衝突時のペナルティスパイクにより、乗車快適性と安定性が著しく低下していた。
  • DRLポリシーは、V2X通信に依存せずに、混雑した交通状況下でも安全な距離を維持し、滑らかな合流動作を実行できるように学習した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。