[论文解读] Probabilistic Prediction of Interactive Driving Behavior via Hierarchical Inverse Reinforcement Learning
本文提出了一种分层逆强化学习(IRL)框架,用于对人类驾驶行为进行概率性、交互感知的预测。通过将驾驶员的决策建模为离散(例如,让行/通过)与连续(例如,轨迹)动作的层次结构,该方法从示范数据中学习奖励函数,以基于自车未来规划条件化的混合分布预测未来轨迹,在匝道汇入场景中相比HMM和神经网络基线方法实现了更高的预测精度。
Autonomous vehicles (AVs) are on the road. To safely and efficiently interact with other road participants, AVs have to accurately predict the behavior of surrounding vehicles and plan accordingly. Such prediction should be probabilistic, to address the uncertainties in human behavior. Such prediction should also be interactive, since the distribution over all possible trajectories of the predicted vehicle depends not only on historical information, but also on future plans of other vehicles that interact with it. To achieve such interaction-aware predictions, we propose a probabilistic prediction approach based on hierarchical inverse reinforcement learning (IRL). First, we explicitly consider the hierarchical trajectory-generation process of human drivers involving both discrete and continuous driving decisions. Based on this, the distribution over all future trajectories of the predicted vehicle is formulated as a mixture of distributions partitioned by the discrete decisions. Then we apply IRL hierarchically to learn the distributions from real human demonstrations. A case study for the ramp-merging driving scenario is provided. The quantitative results show that the proposed approach can accurately predict both the discrete driving decisions such as yield or pass as well as the continuous trajectories.
研究动机与目标
- 为解决自动驾驶中确定性与非交互式预测模型的局限性,这些模型无法充分考虑人类驾驶员对其他车辆未来行为的预期。
- 对人类驾驶员的分层决策过程进行建模,将离散的交互结果(例如,让行或通过)与连续的轨迹生成过程分离。
- 开发一种概率预测框架,将未来轨迹分布的条件设定在历史状态与自车未来规划之上,从而实现交互感知的行为建模。
- 在如匝道汇入等交互式驾驶场景中,提升对离散驾驶决策与连续轨迹的预测精度。
- 通过在真实世界驾驶数据上与HMM和基于神经网络的基线方法进行定量比较,验证该方法的有效性。
提出的方法
- 该方法将人类驾驶行为建模为分层过程:离散决策(例如,让行/通过)定义博弈论结果,而连续决策则塑造平滑、动态的轨迹。
- 将未来轨迹的分布形式化为多个概率分布的混合,每个分布对应一种不同的离散决策结果。
- 应用分层逆强化学习从人类示范数据中推断奖励函数,同时学习离散与连续的成本函数。
- 通过使用学习到的成本函数,采用有限时域模型预测控制(MPC)生成连续轨迹预测,确保动态可行性与平滑性。
- 预测模型基于自车的未来规划进行条件化,使其具备交互感知能力,反映人类驾驶员对他人行为的预期。
- 采用多分量评分指标(B_c = G + C + D)评估预测质量,其中各分量分别衡量泛化性、保守性与非防御性。
实验结果
研究问题
- RQ1分层IRL框架能否在交互式驾驶场景中准确预测离散驾驶决策(例如,让行或通过)与连续轨迹?
- RQ2将预测条件化于自车未来规划,相较于仅依赖历史状态的模型,能否显著提升预测精度?
- RQ3所提出的方法在预测交互感知行为方面,相较于非交互式基线方法(如HMM与神经网络)的性能提升程度如何?
- RQ4混合分布建模方法在多大程度上能够捕捉人类驾驶行为中的不确定性与变异性?
- RQ5从示范数据中学习到的奖励函数能否生成在复杂场景(如匝道汇入)中与真实轨迹高度吻合的轨迹预测?
主要发现
- 所提出的分层IRL方法在B_c指标上取得了最低的总体得分(0.2053),优于HMM(0.2551)与神经网络基线(0.2361)。
- 该方法显著降低了保守性(得分为0.0178)与非防御性(得分为0.0698),表明其运动模式更具现实感且更具批判性。
- 在20条测试轨迹上,连续轨迹预测的平均欧氏距离(MED)为0.6172米,标准差为0.2473米。
- 在三个典型的匝道汇入示例中,预测的最可能轨迹与真实轨迹高度一致,展现出强大的视觉与定量一致性。
- 该方法成功捕捉了自车规划对人类驾驶员行为的影响,实现了反映真实世界驾驶动态的交互感知预测。
- 分层IRL框架能够有效从人类示范中学习离散决策策略与连续轨迹成本函数,实现准确且概率化的行为建模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。