Skip to main content
QUICK REVIEW

[论文解读] How to Assess Trustworthy AI in Practice

Roberto V. Zicari, Julia Amann|arXiv (Cornell University)|Jun 20, 2022
Artificial Intelligence in Healthcare and Education被引用 10
一句话总结

本文提出 Z-Inspection™,一种基于欧盟高层专家小组指南的实用、整体性方法,用于在人工智能全生命周期中评估可信人工智能。该方法通过社会技术情景分析识别伦理风险与张力,并通过真实医疗人工智能评估案例展示其应用,为从业者和研究人员提供可操作的建议。

ABSTRACT

This report is a methodological reflection on Z-Inspection$^{\small{\circledR}}$. Z-Inspection$^{\small{\circledR}}$ is a holistic process used to evaluate the trustworthiness of AI-based technologies at different stages of the AI lifecycle. It focuses, in particular, on the identification and discussion of ethical issues and tensions through the elaboration of socio-technical scenarios. It uses the general European Union's High-Level Expert Group's (EU HLEG) guidelines for trustworthy AI. This report illustrates for both AI researchers and AI practitioners how the EU HLEG guidelines for trustworthy AI can be applied in practice. We share the lessons learned from conducting a series of independent assessments to evaluate the trustworthiness of AI systems in healthcare. We also share key recommendations and practical suggestions on how to ensure a rigorous trustworthy AI assessment throughout the life-cycle of an AI system.

研究动机与目标

  • 开发一种实用、可操作的方法,以评估人工智能系统在其全生命周期各阶段的可信性。
  • 将欧盟高层专家小组关于可信人工智能的指南转化为结构化的评估流程。
  • 通过情景化分析识别并解决人工智能系统中的伦理问题与张力。
  • 为从业者和研究人员提供严谨评估人工智能可信性的具体工具与建议。
  • 分享基于真实医疗人工智能评估的经验教训,以指导更广泛的应用。

提出的方法

  • Z-Inspection™ 采用整体性、迭代式流程,评估人工智能全生命周期中的可信性。
  • 将欧盟 HLEG 的可信人工智能关键要求(如人为监督、鲁棒性、公平性)整合进结构化评估框架。
  • 该方法以社会技术情景的创建与分析为核心,以在具体情境中探索伦理张力与风险。
  • 通过跨学科团队开展评估,确保对伦理与技术维度的多元视角。
  • 流程包括记录发现结果、利益相关者反馈,以及缓解与改进的建议。
  • 该方法设计为可跨领域适配,已在医疗人工智能系统中得到实际应用。

实验结果

研究问题

  • RQ1如何在真实的人工智能开发与部署中实际应用欧盟 HLEG 关于可信人工智能的指南?
  • RQ2何种方法论能够实现对人工智能系统中伦理风险与张力的系统性识别?
  • RQ3社会技术情景如何有效揭示人工智能开发过程中隐藏的伦理问题?
  • RQ4基于该框架对医疗人工智能系统进行独立评估,可总结出哪些经验教训?
  • RQ5如何在人工智能开发全生命周期中制度化可扩展且严谨的评估流程?

主要发现

  • Z-Inspection™ 有效将欧盟 HLEG 的可信人工智能标准转化为可重复、实用的评估流程。
  • 社会技术情景的应用被证明能有效揭示技术审计本身无法捕捉的伦理张力与情境风险。
  • 医疗人工智能评估揭示了数据偏差、透明度以及人机协作方面的反复出现挑战。
  • 跨学科协作显著提升了伦理风险识别的深度与相关性。
  • 该框架在不同人工智能系统与开发阶段均表现出良好适应性,支持早期设计与部署后评估。
  • 实践中涌现出具体建议,例如在开发早期嵌入伦理审查,并在整个过程中确保利益相关者参与。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。