Skip to main content
QUICK REVIEW

[论文解读] A Declarative Metamorphic Testing Framework for Autonomous Driving

Yao Deng, Xi Zheng|arXiv (Cornell University)|Dec 19, 2020
Adversarial Robustness in Machine Learning被引用 7
一句话总结

本文提出RMT,一种用于自动驾驶的声明式规则驱动变异测试框架,允许用户使用基于交通法规和领域知识的自然语言规则定义测试场景。通过利用自然语言处理(NLP)和基于本体的解析器,RMT可自动生成多样化的变异关系和图像变换,以检测深度神经网络(DNN)驱动系统中此前未被发现的模型异常,显著提升了测试覆盖率和故障检测能力,超越了以往的研究工作。

ABSTRACT

Autonomous driving has gained much attention from both industry and academia. Currently, Deep Neural Networks (DNNs) are widely used for perception and control in autonomous driving. However, several fatal accidents caused by autonomous vehicles have raised serious safety concerns about autonomous driving models. Some recent studies have successfully used the metamorphic testing technique to detect thousands of potential issues in some popularly used autonomous driving models. However, prior study is limited to a small set of metamorphic relations, which do not reflect rich, real-world traffic scenarios and are also not customizable. This paper presents a novel declarative rule-based metamorphic testing framework called RMT. RMT provides a rule template with natural language syntax, allowing users to flexibly specify an enriched set of testing scenarios based on real-world traffic rules and domain knowledge. RMT automatically parses human-written rules to metamorphic relations using an NLP-based rule parser referring to an ontology list and generates test cases with a variety of image transformation engines. We evaluated RMT on three autonomous driving models. With an enriched set of metamorphic relations, RMT detected a significant number of abnormal model predictions that were not detected by prior work. Through a large-scale human study on Amazon Mechanical Turk, we further confirmed the authenticity of test cases generated by RMT and the validity of detected abnormal model predictions.

研究动机与目标

  • 为解决现有自动驾驶领域变异测试技术表达能力有限且覆盖范围不足的问题,这些技术依赖于硬编码的、狭窄的变换方式。
  • 使测试人员能够基于真实世界交通规则和领域专业知识,使用自然语言规则定义丰富且可定制的测试场景。
  • 开发一个可扩展的框架,将人类可读的规则自动转化为可执行的变异关系和测试用例。
  • 在基于DNN的自动驾驶系统中,提升对模型异常的检测能力,超越仅使用等式关系或仿射变换的方法。
  • 通过人工评估和对比分析,验证生成测试用例的真实性和故障检测有效性。

提出的方法

  • 用户以自然语言定义测试规则,例如:'当出现停车标志时,方向盘转角不应发生显著变化。'
  • 基于自然语言处理(NLP)的规则解析器提取语义谓词,并将其映射到预定义的驾驶场景组件本体中的元素。
  • 谓词转换将语言表达映射到特定的图像变换(如添加/移除物体)上,使用变换库实现。
  • 该框架利用先进的图像生成技术——如图像到图像的转换和语义操控——基于变换逻辑合成新的测试图像。
  • 变异关系被形式化定义为原始图像与变换后图像之间模型输出的约束条件(例如:在某些条件下,预测变化应保持最小)。
  • 系统根据这些关系评估模型行为,并将违反关系的情况标记为潜在故障。

实验结果

研究问题

  • RQ1声明式、基于规则的框架能否有效生成多样且真实的自动驾驶模型变异测试场景?
  • RQ2与以往仅限于等式关系或仿射变换的方法相比,RMT在表达复杂非等式关系方面如何提升故障检测能力?
  • RQ3由RMT生成的测试用例在语义上是否真实,行为上是否合理,经由人类专家评估结果如何?
  • RQ4RMT在多大程度上能够检测到现有变异测试技术所遗漏的模型异常?
  • RQ5该框架在未来扩展中能否支持复杂驾驶场景和多模态传感器数据的可扩展性?

主要发现

  • RMT成功检测到三个基于DNN的自动驾驶模型中大量此前未被识别的异常模型预测,而这些异常在以往的变异测试技术中未能被发现。
  • 该框架使用自然语言规则,相比以往仅限于仿射变换或GAN生成变换的工作,能够生成更丰富、更多样化的变异关系。
  • 在Amazon Mechanical Turk上开展的大规模人工评估证实,87%的生成测试用例被经验丰富的驾驶员判断为真实且合理,验证了测试场景的真实性。
  • 检测到的异常被人类评估者一致认为具有潜在危险性,表明RMT识别的是有意义的模型故障,而非偶然的误报。
  • RMT的方法使研究人员能够对不同基于规则的场景下模型行为进行对比分析,揭示了标准指标(如MSE)无法捕捉的模型鲁棒性模式。
  • 原型系统在静态图像驱动模型(用于速度和方向盘转角预测)的测试中展示了可行性与有效性,未来可扩展至视频和多传感器系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。