[论文解读] Adapting SQuaRE for Quality Assessment of Artificial Intelligence Systems
本文通过整合欧洲委员会《可信人工智能伦理指南》中的原则,将ISO/IEC SQuaRE质量评估框架适配于基于机器学习的AI系统。它识别出SQuaRE质量特性及其子特性的重要更新——特别是将可靠性扩展以包含可复现性,将隐私作为子特性加入,并在元层级引入问责制——从而实现对AI系统质量的全面评估,超越传统软件度量标准。
More and more software practitioners are tackling towards industrial applications of artificial intelligence (AI) systems, especially those based on machine learning (ML). However, many of existing principles and approaches to traditional systems do not work effectively for the system behavior obtained by training not by logical design. In addition, unique kinds of requirements are emerging such as fairness and explainability. To provide clear guidance to understand and tackle these difficulties, we present an analysis on what quality concepts we should evaluate for AI systems. We base our discussion on ISO/IEC 25000 series, known as SQuaRE, and identify how it should be adapted for the unique nature of ML and $ extit{Ethics guidelines for trustworthy AI}$ from European Commission. We thus provide holistic insights for quality of AI systems by incorporating the ML nature and AI ethics to the traditional software quality concepts.
研究动机与目标
- 应对针对基于机器学习的AI系统量身定制的质量评估框架日益增长的需求,这些系统在设计和行为上与传统软件存在根本性差异。
- 识别在应用于AI系统时,现有SQuaRE框架因机器学习组件的黑箱性和数据驱动性而存在的缺陷。
- 将欧洲委员会《可信人工智能伦理指南》中的伦理要求整合进SQuaRE,以增强其在现实世界AI应用中的相关性。
- 为SQuaRE质量模型提供可操作的、概念层面的更新,以支持工业界从业者对AI系统质量进行整体评估。
- 为未来在AI开发中研究内部质量方面(如数据整理、模型训练和运行时监控)奠定基础。
提出的方法
- 对ISO/IEC 25000 SQuaRE框架与欧洲委员会《可信人工智能伦理指南》进行对比分析。
- 评估SQuaRE各项质量特性及其子特性的有效性与完整性,当应用于基于机器学习的AI系统时。
- 识别因机器学习特有属性(如缺乏可解释性、参数驱动行为)而使SQuaRE概念失效的情况,并提出必要修改。
- 将《伦理指南》中的伦理要求(尤其是公平性、可解释性、问责制和隐私)映射到SQuaRE的分层结构中。
- 提出新的子特性(如安全下的隐私、可靠性下的可复现性)以及元层级考量(如问责制的可审计性和可追溯性)。
- 使用树状结构分析,将伦理子要求与SQuaRE质量模型对齐,确保可追溯性与可扩展性。
实验结果
研究问题
- RQ1机器学习的黑箱性与数据驱动性如何使传统SQuaRE质量特性失效或限制其适用性?
- RQ2欧洲委员会《可信人工智能伦理指南》中的哪些质量方面在当前SQuaRE框架中缺失或表示不足?
- RQ3为扩展SQuaRE质量模型以涵盖机器学习特异性和伦理质量维度(如公平性、可解释性、可复现性),需要哪些具体修改?
- RQ4如何在不彻底重构其核心结构的前提下,有意义地将问责制与可审计性整合进SQuaRE?
- RQ5现有SQuaRE质量度量在多大程度上支持对AI系统质量的评估,超越准确性和可靠性?
主要发现
- 当前SQuaRE框架未能充分应对基于机器学习的AI系统所面临的独特质量挑战,如缺乏可解释性以及对训练数据的高度敏感性。
- ‘可复现性’——由于随机性和超参数敏感性在机器学习中至关重要——在SQuaRE中未被明确涵盖,应作为‘可靠性’下的子特性加入。
- 隐私必须从‘安全’的子特性提升为产品质量模型中的一等质量子特性,以反映其日益重要的地位。
- 《伦理指南》中对‘问责制’的要求未被SQuaRE直接支持,需引入元层级考量,如审计轨迹和决策记录。
- SQuaRE中的‘可追溯性’子特性对AI系统而言不足;必须重新解释为包含算法决策日志和来源追踪,以支持合规与审计。
- 《伦理指南》中七个关键要求中的大多数未被SQuaRE完全覆盖,表明当前软件质量标准在可信AI方面存在显著缺口。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。