Skip to main content
QUICK REVIEW

[论文解读] Framework for Certification of AI-Based Systems

Maxime Gariel, Brian Shimanuki|arXiv (Cornell University)|Feb 21, 2023
Risk and Safety Analysis被引用 7
一句话总结

本文提出一种面向安全关键航空航天应用中基于AI系统的认证的数据中心框架,强调需求、训练数据、模型和测试结果之间的可追溯性。通过训练一个用于机载入侵者探测的深度神经网络(DNN),实现了79%的平均精确率,展示了如何系统性地分析输入变化(如距离)对认证准备度的影响。

ABSTRACT

The current certification process for aerospace software is not adapted to "AI-based" algorithms such as deep neural networks. Unlike traditional aerospace software, the precise parameters optimized during neural network training are as important as (or more than) the code processing the network and they are not directly mathematically understandable. Despite their lack of explainability such algorithms are appealing because for some applications they can exhibit high performance unattainable with any traditional explicit line-by-line software methods. This paper proposes a framework and principles that could be used to establish certification methods for neural network models for which the current certification processes such as DO-178 cannot be applied. While it is not a magic recipe, it is a set of common sense steps that will allow the applicant and the regulator increase their confidence in the developed software, by demonstrating the capabilities to bring together, trace, and track the requirements, data, software, training process, and test results.

研究动机与目标

  • 为解决传统认证标准(如DO-178)在AI系统(特别是深度神经网络DNN)应用中的局限性,尤其是由于其参数化和非确定性行为导致的数学可追溯性缺失问题。
  • 开发一种框架,实现对需求、训练数据、模型权重、训练过程和测试结果的系统性追踪与可追溯性,以增强监管机构的信心。
  • 通过一个真实应用场景(基于视觉的航空探测与避让DNN训练)证明该框架的可行性。
  • 评估模型在不同输入变化(如距离、光照和天气条件)下的泛化能力和敏感性,这些因素对安全认证至关重要。
  • 为未来在认证机器学习流水线中集成形式化验证、对抗性鲁棒性测试和自动化数据生成奠定基础。

提出的方法

  • 该框架通过元数据丰富的数据管理,实现从系统级需求到训练数据、模型权重和测试结果的端到端可追溯性。
  • 采用数据为中心的方法,每张图像均标注有诸如与目标的距离、光照、天气、背景类型和序列信息等属性,以支持统计分析。
  • 使用标准DNN架构(SSD FPN结合ResNet-50)在经过筛选的数据集上进行训练,数据集划分为724张训练图像和379张测试图像,并在COCO数据集上进行预训练。
  • 通过将测试数据按距离区间(0–375米、375–750米等)划分,执行敏感性分析,以评估不同运行条件下性能的变化。
  • 该框架支持在多样化输入场景下对模型性能和泛化能力进行统计评估,使监管机构能够评估其鲁棒性。
  • 通过存储并追踪扰动输入(对抗性样本)与标准数据并列,支持对抗性样本测试,便于进行稳定性分析。
Figure 1: Process for tracking an object using a radar.
Figure 1: Process for tracking an object using a radar.

实验结果

研究问题

  • RQ1当传统基于代码的验证不足以满足认证标准时,如何提升AI系统可追溯性以满足认证要求?
  • RQ2为确保模型在不同运行条件(如光照、天气和距离)下的泛化能力,需要哪些元数据和数据管理实践?
  • RQ3如何对输入变化(如与目标的距离)的敏感性进行定量评估并记录以供认证使用?
  • RQ4数据中心框架是否能够在不依赖模型权重数学形式化表达的前提下,支持对模型性能的统计置信度?
  • RQ5系统化的数据来源记录和元数据在支持安全关键系统中AI模型的监管审查与可审计性方面发挥什么作用?

主要发现

  • 该DNN在测试集上对飞机入侵者检测的平均精确率达到79%,证明了该应用场景下的基准性能。
  • 随着距离增加,模型性能下降,在0–375米区间内平均精确率最高,而在1115–1500米区间最低,表明对距离具有敏感性。
  • 该框架成功实现了按输入属性(如距离)对测试数据进行系统性划分,支持针对性的性能分析。
  • 通过使用元数据(如光照、天气、背景类型),实现了对数据集多样性和模型鲁棒性的定性和定量评估。
  • 该框架支持通过追踪扰动输入实现对抗性样本测试,有助于在认证过程中进行稳定性分析。
  • 该方法为在模型权重无法进行数学解释的情况下,提供对模型在不同运行领域行为的统计置信度奠定了基础。
Figure 2: Example of a DNN.
Figure 2: Example of a DNN.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。