QUICK REVIEW
[论文解读] Adaptive Game-Theoretic Decision Making for Autonomous Vehicle Control at Roundabouts
Ran Tian, Sisi Li|arXiv (Cornell University)|Oct 1, 2018
Traffic control and management参考文献 9被引用 11
一句话总结
本文提出了一种自适应博弈论决策算法,用于自动驾驶车辆在环岛处的行驶,通过动态驾驶员类型估计框架对自车与对手车辆的交互进行建模。控制器采用在线信念更新与函数逼近技术,实现实时、安全且高效的导航,在模拟环境中成功率达93.4%,在人类驾驶员参与的实验中成功率达88.6%。
ABSTRACT
In this paper, we propose a decision making algorithm for autonomous vehicle control at a roundabout intersection. The algorithm is based on a game-theoretic model representing the interactions between the ego vehicle and an opponent vehicle, and adapts to an online estimated driver type of the opponent vehicle. Simulation results are reported.
研究动机与目标
- 开发一种适用于环岛场景的自动驾驶车辆决策框架,以考虑与其他驾驶员的战略性交互。
- 采用博弈论方法对车辆交互进行建模,捕捉不同驾驶员行为(如保守型与激进型)的差异。
- 通过在线估计对手驾驶员类型并结合信念更新,实现实时自适应。
- 利用函数逼近技术高效实现控制器,避免运行时求解复杂优化问题。
- 在模拟环境与人机协同场景中验证控制器的性能。
提出的方法
- 车辆运动学采用离散时间系统建模,状态变量包括位置、速度、航向角和偏航率。
- 采用模型预测控制框架,累积奖励通过线性奖励函数 $ R(t) = \mathbf{w}^\intercal \mathbf{\Phi}(t) $ 计算,作为特征的加权和。
- 采用双类型驾驶员模型:类型-1(保守型)让行,类型-2(激进型)试图优先通过。
- 控制器维护对对手驾驶员类型的信念状态 $ \mathbb{P}^{(2)}(t) $,基于观测到的行为通过贝叶斯推理进行更新。
- 通过神经网络进行函数逼近,以在线估计价值函数与策略,实现高效实时计算。
- 控制器通过求解基于估计信念与奖励函数的有限时域优化问题来选择动作。
实验结果
研究问题
- RQ1当与异构驾驶员类型交互时,自动驾驶车辆如何实现安全且高效的环岛通行?
- RQ2结合在线驾驶员类型估计的博弈论模型是否能提升多车环岛场景下的决策能力?
- RQ3在与模拟车辆及人工驾驶车辆交互时,该自适应控制器在碰撞规避与成功率方面的表现如何?
- RQ4函数逼近在实现复杂博弈论控制器的实时运行方面效果如何?
- RQ5对对手类型进行信念更新如何影响自车在动态交通交互中的战略决策?
主要发现
- 在1,000次模拟运行中,初始条件与对手类型随机生成,控制器成功率达93.4%,避免了碰撞、压线及死锁。
- 在7名操作员参与的人机协同模拟中,控制器成功率达88.6%,表现出对真实驾驶行为变异的鲁棒性。
- 当激进型(类型-2)驾驶员试图优先通过时,控制器100%正确识别其类型,并通过让行避免冲突。
- 当人类驾驶员初始表现激进但随后减速时,控制器将其信念更新为类型-1,并加速抢先通过,展现出良好的自适应响应能力。
- 在配备GPU的标准笔记本电脑上,单次完整控制周期(状态估计、信念更新与动作生成)的平均计算时间为34.1 ms。
- 信念更新机制 $ \mathbb{P}^{(2)}(t) $ 成功跟踪了对手行为的变化,仿真轨迹中观察到清晰的收敛模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。