[论文解读] TARGET: Automated Scenario Generation from Traffic Rules for Testing Autonomous Vehicles via Validated LLM-Guided Knowledge Extraction
TARGET 是一个端到端框架,通过使用大型语言模型(GPT-4)从自然语言交通规则中提取并映射规则,自动将规则转化为一种定制的领域特定语言(DSL),从而生成可用于仿真的可执行场景脚本。该框架在四个自动驾驶系统(ADS)中发现了700多个规则违规和系统故障,并提供了详细的日志,支持高效调试。
Recent incidents with autonomous vehicles highlight the need for rigorous testing to ensure safety and robustness. Constructing test scenarios for autonomous driving systems (ADSs), however, is labor-intensive. We propose TARGET, an end-to-end framework that automatically generates test scenarios from traffic rules. To address complexity, we leverage a Large Language Model (LLM) to extract knowledge from traffic rules. To mitigate hallucinations caused by large context during input processing, we introduce a domain-specific language (DSL) designed to be syntactically simple and compositional. This design allows the LLM to learn and generate test scenarios in a modular manner while enabling syntactic and semantic validation for each component. Based on these validated representations, TARGET synthesizes executable scripts to render scenarios in simulation. Evaluated seven ADSs with 284 scenarios derived from 54 traffic rules, TARGET uncovered 610 rule violations, collisions, and other issues. For each violation, TARGET generates scenario recordings and detailed logs, aiding root cause analysis. Two identified issues were confirmed by ADS developers: one linked to an existing bug report and the other to limited ADS functionality.
研究动机与目标
- 解决现有基于自然语言交通规则手动定义自动驾驶系统(ADS)测试场景时所面临的劳动密集且易出错的问题。
- 克服现有 DSL 和基于 NLP 的规则提取方法的局限性,这些方法通常需要手动简化或受句法复杂性影响。
- 实现直接从真实世界交通规则的自然语言描述中,自动化、可扩展且准确地生成测试场景。
- 通过减少人工工作量并提高对边缘情况和规则违规的覆盖度,提升自动驾驶系统测试的效率与效果。
- 提供详细的诊断报告和场景记录,以支持对检测到的自动驾驶系统行为问题的根本原因分析与验证。
提出的方法
- 设计一种轻量级、表达能力强的领域特定语言(DSL),专用于描述基于交通规则的测试场景,采用简化的语法。
- 通过多阶段上下文 few-shot 学习提示工程方法,利用 GPT-4 解析自然语言交通规则,并将其映射为 DSL 表示。
- 实现基于模板的场景生成流水线,通过字典查找和基于层级的地图路径搜索,准确填充场景参数。
- 通过其原生 API 集成 Carla 仿真器,生成可用于执行仿真的可执行场景脚本。
- 应用结合 LLM 推理与句法验证的规则解析流水线,确保 DSL 兼容性并提高解析准确性。
- 为每次测试运行生成全面的测试报告和场景记录,包括规则违规、碰撞和导航失败的日志。
实验结果
研究问题
- RQ1大型语言模型能否有效从自然语言交通规则中提取并结构化关键元素,转化为用于测试场景生成的正式 DSL 表示?
- RQ2与手动或传统 NLP 方法相比,所提出的 LLM 引导的解析流水线在将真实世界交通规则准确转换为可执行场景脚本方面的有效性如何?
- RQ3所生成的场景在多大程度上能够发现自动驾驶系统中先前未知或已存在的规则违规和系统故障?
- RQ4该框架的自动化场景生成如何减轻手动测试编写负担,同时保持高场景多样性与覆盖率?
- RQ5该框架生成的诊断输出(日志与记录)是否能够支持对识别出的自动驾驶系统问题的可靠根因分析?
主要发现
- TARGET 使用德克萨斯州驾驶员手册中的交通规则,在八个不同地图上成功生成了 217 个测试场景。
- 该框架在四个自动驾驶系统(LAV、MMFN、AUTO 和 Autoware)中识别出约 700 种不同的错误行为,包括规则违规、碰撞和导航失败。
- 消融研究证实,所提出的 LLM 引导的解析流水线优于仅使用 GPT-4 直接生成的方法,证明了结构化提示工程的价值。
- 规则解析器在将基准交通规则以 DSL 表示时达到了 91.8% 的准确率,表明其对自然语言交通规则语义有较强的掌握能力。
- 两个此前未知的问题经自动驾驶系统开发人员确认:一个与感知失败有关(Autoware 中漏检静态物体),另一个与 MMFN 中的定位不准确有关。
- 其中一个检测到的问题已在公开的错误报告中记录,验证了该框架识别真实世界自动驾驶系统缺陷的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。