[论文解读] scenoRITA: Generating Less-Redundant, Safety-Critical and Motion Sickness-Inducing Scenarios for Autonomous Vehicles
scenoRITA 是一种用于自动驾驶汽车的基于搜索的测试框架,采用完全可变的障碍物表示方式,并结合五种测试判据——三种用于安全(碰撞、超速、不安全变道)和两种用于晕动症(急加速、急刹车)——以生成多样化、非冗余、具有安全关键性且引发不适感的驾驶场景。与随机方法和部分可变方法相比,其违规检测率分别提高了 23.47% 和 24.21%,在每种场景 63.92 秒内检测到 1,026 个唯一违规。
There is tremendous global enthusiasm for research, development, and deployment of autonomous vehicles (AVs), e.g., self-driving taxis and trucks from Waymo and Baidu. The current practice for testing AVs uses virtual tests-where AVs are tested in software simulations-since they offer a more efficient and safer alternative compared to field operational tests. Specifically, search-based approaches are used to find particularly critical situations. These approaches provide an opportunity to automatically generate tests; however, systematically creating valid and effective tests for AV software remains a major challenge. To address this challenge, we introduce scenoRITA, a test generation approach for AVs that uses evolutionary algorithms with (1) a novel gene representation that allows obstacles to be fully mutable, hence, resulting in more reported violations, (2) 5 test oracles to determine both safety and motion sickness-inducing violations, and (3) a novel technique to identify and eliminate duplicate tests. Our extensive evaluation shows that scenoRITA can produce effective driving scenarios that expose an ego car to safety critical situations. scenoRITA generated tests that resulted in a total of 1,026 unique violations, increasing the number of reported violations by 23.47% and 24.21% compared to random test generation and state-of-the-art partially-mutable test generation, respectively.
研究动机与目标
- 为系统性地生成有效、非冗余、具有安全关键性且引发不适感的自动驾驶汽车(AV)软件测试场景,解决该挑战。
- 克服现有基于搜索的测试方法在障碍物属性仅部分可变以及测试判据有限方面的局限性,特别是忽略乘客舒适度和晕动症的问题。
- 通过在自动驾驶汽车规划系统中集成针对安全和引发晕动症行为的领域特定判据,提升安全保证水平并改善乘客体验。
- 通过引入一种新颖技术,在测试生成过程中检测并消除重复场景,从而降低测试冗余。
- 在量产级自动驾驶系统(百度 Apollo)上评估该框架,并证明其在违规检测方面优于随机方法和最先进的部分可变方法。
提出的方法
- scenoRITA 采用进化算法,并引入一种新颖的基因表示方式,实现对障碍物属性(如位置、速度、航向、类型、尺寸和移动性)的完全可变性,确保生成多样化且有效的障碍物轨迹。
- 框架集成五种测试判据:碰撞检测、超速检测、不安全变道、急加速和急刹车,每种判据均基于 Apollo 的驾驶行为评分指标映射到相应的适应度函数。
- 利用来自权威来源(如 SAE J3016 自动化等级标准和 Apollo 的行为指南)的领域特定约束,确保生成场景的真实性和有效性。
- 提出一种新颖的重复场景检测技术,在进化过程中识别并消除冗余场景,从而提升测试的多样性与效率。
- 该方法支持多种障碍物操作行为,包括车道保持、变道、转弯、U型转弯和并道,超越以往研究中有限的动作范围。
- scenoRITA 在百度 Apollo(一个 L4 级开源自动驾驶软件栈)上进行评估,采用受控仿真环境,以衡量违规检测率和场景多样性。
实验结果
研究问题
- RQ1在进化测试生成中采用完全可变的障碍物表示,是否能显著增加自动驾驶汽车测试中唯一的安全相关和引发晕动症的违规数量?
- RQ2与仅使用一个或两个判据的先前方法相比,scenoRITA 使用五种多样化判据(三种安全相关,两种晕动症相关)在检测关键违规方面表现如何?
- RQ3所提出的重复检测技术与现有方法相比,在多大程度上减少了生成测试场景的冗余性?
- RQ4在相同时间预算内,scenoRITA 是否在违规检测率和场景多样性方面优于随机测试生成方法和最先进的部分可变方法?
- RQ5该框架是否能有效生成复杂且真实的交通场景,以压力测试自动驾驶汽车软件的规划模块,特别是在涉及突然操作的边缘情况中?
主要发现
- scenoRITA 在所有类别中总共生成了 1,026 个唯一违规,包括 386起碰撞、21起超速违规、291起不安全变道、132起急加速事件和 196 起急刹车事件。
- 在相同 63.92 秒/场景的时间预算内,与随机测试生成相比,scenoRITA 的唯一违规数增加了 23.47%;与最先进的部分可变方法(scenoRITA⁻)相比,增加了 24.21%。
- 采用完全可变的障碍物表示方式,使得场景生成更加多样化和复杂,从而相比仅部分修改障碍物属性的方法,显著提升了唯一违规的检测率。
- 新颖的重复检测技术显著降低了冗余性,确保生成的场景彼此不同,并对测试覆盖具有实质性贡献。
- 集成引发晕动症的判据(急加速和急刹车)揭示了此前被忽视的与不适感相关的边缘情况,凸显了在自动驾驶汽车测试中纳入乘客舒适度的重要性。
- 在百度 Apollo(一个量产级 L4 级自动驾驶系统)上的评估结果表明,scenoRITA 能够有效对规划模块施加压力,而该模块在自动驾驶软件中被公认为最易出错的部分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。