[论文解读] Risk-averse Behavior Planning for Autonomous Driving under Uncertainty
本文提出了一种在不确定性环境下用于自动驾驶车辆的风险规避型行为规划框架,通过整合QMDP、无迹变换(unscented transform)和改进的蒙特卡洛树搜索(MCTS),对传感器测量值和环境状态中的不确定性进行建模与传播。该方法在部分可观察环境下实现了稳健的决策,实现了在有限传感器范围或被遮挡的变道车辆场景下,速度与加速度变化率(jerk)之间的更安全权衡。
Autonomous vehicles have to navigate the surrounding environment with partial observability of other objects sharing the road. Sources of uncertainty in autonomous vehicle measurements include sensor fusion errors, limited sensor range due to weather or object detection latency, occlusion, and hidden parameters such as other human driver intentions. Behavior planning must consider all sources of uncertainty in deciding future vehicle maneuvers. This paper presents a scalable framework for risk-averse behavior planning under uncertainty by incorporating QMDP, unscented transform, and Monte Carlo tree search (MCTS). It is shown that upper confidence bound (UCB) for expanding the tree results in noisy Q-value estimates by the MCTS and a degraded performance of QMDP. A modification to action selection procedure in MCTS is proposed to achieve robust performance.
研究动机与目标
- 解决由于传感器噪声、遮挡以及人类意图不确定导致的环境部分可观察性所带来的安全且舒适的自动驾驶挑战。
- 开发一种可扩展的决策框架,显式建模测量值和环境状态中的不确定性,以提升安全性。
- 通过追踪不仅期望结果,还包括在不确定情景下奖励方差的机制,实现风险规避型行为规划。
- 通过在MCTS中修改动作选择策略以应对信念传播带来的噪声Q值估计,提升树搜索的样本效率和鲁棒性。
- 在两种关键高速公路驾驶场景中验证框架的有效性:视场受限场景和部分观测到的变道车辆场景。
提出的方法
- 使用QMDP通过从信念状态采样并近似不确定性下的值函数来求解POMDP。
- 应用无迹变换(sigma点采样)将传感器测量值(如速度噪声)中的不确定性通过信念状态进行传播,同时保持均值和协方差。
- 为每个不确定的状态变量构建三个sigma点——均值以及±√2σ的扰动,以表示变道车辆纵向速度的不确定性。
- 通过引入考虑Q值估计方差的风险规避准则,修改MCTS的动作选择策略,提升对噪声滚动结果的鲁棒性。
- 在长规划时域内进行树搜索,基于多个sigma点实现对所有允许动作(如保持车道、变道)的评估。
- 使用带有参数α=0.01和ε=1的风险规避效用函数,在不确定性较高时优先考虑安全性而非激进性。
实验结果
研究问题
- RQ1如何有效建模并传播传感器测量值中的不确定性(如受天气或遮挡影响的速度噪声),以支持风险规避型决策?
- RQ2与标准MCTS相比,具有方差感知动作选择的改进MCTS在噪声或不确定观测下,其鲁棒性提升程度如何?
- RQ3在传感器范围受限的场景下,所提出的框架能否实现安全性(如低加速度变化率)与性能(如平均速度)之间的平衡权衡?
- RQ4当初始测量值不准确或延迟时,该框架如何处理部分观测到的变道车辆?
- RQ5将无迹变换与QMDP及MCTS结合,能否在高维不确定性下实现高效且可扩展的行为规划?
主要发现
- 在视场受限场景中,RA-QMDP通过提前减速实现了更安全的决策,与MCTS-Noisy相比,到达变道点时与变道车辆的距离为30.67m(MCTS-Noisy为15.8m),时间头驰为1.41s(MCTS-Noisy为0.54s),后者导致了危险情况。
- MCTS-Noisy由于在发现初始速度估计错误后采取激进减速,导致加速度变化率高达-6.8 m/s³;而RA-QMDP则保持了更稳定且安全的加速度变化率4.0 m/s³。
- RA-QMDP在时间头驰方面优于MCTS-Noisy(1.41s vs. 0.54s),表明尽管最终速度略低(18.32 m/s vs. 20.38 m/s),但其安全裕度更高。
- 该框架通过考虑变道车辆实际速度可能快于报告值的可能性,成功降低了碰撞风险,即使平均估计值显示其速度较慢。
- 采用风险规避动作选择的改进MCTS有效降低了噪声Q值估计带来的性能退化,在不确定条件下优于标准MCTS。
- RA-QMDP通过将树搜索路径专门分配给高不确定性sigma点,成功在处理罕见但关键事件时保持了鲁棒性,确保关键场景未被忽略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。