Skip to main content
QUICK REVIEW

[论文解读] Adversarial Evaluation of Autonomous Vehicles in Lane-Change Scenarios

Baiming Chen, Xiang Chen|arXiv (Cornell University)|Apr 14, 2020
Autonomous Vehicle Technology and Safety参考文献 37被引用 13
一句话总结

该论文提出了一种基于深度强化学习的自适应对抗性评估框架,用于自动驾驶车辆,通过生成动态且具有挑战性的变道场景来实现。通过采用集成策略和非参数贝叶斯聚类方法,该方法能高效识别并利用基于规则和学习型驾驶模型的性能弱点,在强化学习模型上实现了90.6%的碰撞率,相较于静态方法展现出更优的场景多样性与评估效率。

ABSTRACT

Autonomous vehicles must be comprehensively evaluated before deployed in cities and highways. However, most existing evaluation approaches for autonomous vehicles are static and lack adaptability, so they are usually inefficient in generating challenging scenarios for tested vehicles. In this paper, we propose an adaptive evaluation framework to efficiently evaluate autonomous vehicles in adversarial environments generated by deep reinforcement learning. Considering the multimodal nature of dangerous scenarios, we use ensemble models to represent different local optimums for diversity. We then utilize a nonparametric Bayesian method to cluster the adversarial policies. The proposed method is validated in a typical lane-change scenario that involves frequent interactions between the ego vehicle and the surrounding vehicles. Results show that the adversarial scenarios generated by our method significantly degrade the performance of the tested vehicles. We also illustrate different patterns of generated adversarial environments, which can be used to infer the weaknesses of the tested vehicles.

研究动机与目标

  • 解决当前自动驾驶车辆评估方法效率低下且依赖稀有自然驾驶数据的静态特性问题。
  • 开发一种自适应的闭环框架,通过将周围车辆建模为自适应对手,生成动态且高风险的场景。
  • 通过对抗性策略生成,发现稀有但高影响的故障模式,提升评估的完整性。
  • 利用非参数贝叶斯方法对多样化对抗行为进行聚类,实现对自动驾驶车辆弱点的系统性分析。
  • 通过可调奖励超参数校准对抗性理性程度,平衡攻击性与交通规则遵守。

提出的方法

  • 该框架将周围车辆视为对抗性智能体,通过深度强化学习训练,以在变道过程中最大化对自车的干扰为目标。
  • 采用深度强化学习策略的集成方法,探索多个局部最优解,提升生成的对抗性场景的多样性。
  • 应用非参数贝叶斯聚类方法(狄利克雷过程混合模型),根据行为模式对相似的对抗性策略进行分组。
  • 对抗性奖励函数定义为 r_adv = -r_ego + β·r_rule,其中 r_ego 衡量自车性能,r_rule 对交通规则违规行为进行惩罚。
  • 该方法以闭环方式运行,根据自车行为实时调整对抗策略,实现动态场景生成。
  • 在模拟的变道场景中对框架进行验证,涉及自车与周围车辆的交互,通过碰撞率和状态分布偏移来评估性能。

实验结果

研究问题

  • RQ1对抗性深度强化学习能否有效生成多样化的高风险场景,以暴露自动驾驶车辆决策中的弱点?
  • RQ2与单策略方法相比,集成策略与聚类方法在提升对抗性场景多样性与覆盖范围方面有何改进?
  • RQ3该框架在多大程度上能识别出在自然驾驶数据中代表性不足的稀有高影响故障模式?
  • RQ4奖励超参数 β 如何影响对抗性行为的理性程度与可利用性?
  • RQ5该对抗性评估框架在场景发现与性能退化方面,是否优于静态的数据驱动评估方法?

主要发现

  • 对抗性评估框架显著降低了基于规则和强化学习的变道模型性能,在强化学习模型上观察到90.6%的碰撞率。
  • 对抗性场景的状态分布明显更窄且更集中于高风险区域,表明对危险构型实现了高效定位。
  • 对抗性策略的集成方法成功探索了多种故障模式,如前方阻挡与后方紧随,这些模式在单策略方法中未能被均匀覆盖。
  • 非参数贝叶斯聚类方法能有效将对抗性策略划分为不同的行为模式,实现对故障机理的可解释性分析。
  • 调节奖励超参数 β 可控制对抗性理性程度:β 值较低时导致不切实际的违规行为,而 β=1 时在攻击性与现实性之间实现平衡。
  • 与静态自然驾驶评估相比,该框架在发现稀有高影响场景方面表现出更优的效率,可视为高维策略空间中的高效搜索算法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。