Skip to main content
QUICK REVIEW

[论文解读] Hows and Whys of Artificial Intelligence for Public Sector Decisions: Explanation and Evaluation

Alun Preece, Rob Ashelford|arXiv (Cornell University)|Sep 28, 2018
Explainable Artificial Intelligence (XAI)参考文献 15被引用 4
一句话总结

本文提出了一套框架,用于在公共部门决策中评估和解释人工智能/机器学习系统,通过建模人机决策循环,并将评估与解释挑战映射到四种策略:使命导向、数据导向、工作导向和证据导向。研究表明,将人工智能评估与组织成果及人机协作对齐,可提升信任度、问责制和影响力,为公共部门采纳提供可操作的路径。

ABSTRACT

Evaluation has always been a key challenge in the development of artificial intelligence (AI) based software, due to the technical complexity of the software artifact and, often, its embedding in complex sociotechnical processes. Recent advances in machine learning (ML) enabled by deep neural networks has exacerbated the challenge of evaluating such software due to the opaque nature of these ML-based artifacts. A key related issue is the (in)ability of such systems to generate useful explanations of their outputs, and we argue that the explanation and evaluation problems are closely linked. The paper models the elements of a ML-based AI system in the context of public sector decision (PSD) applications involving both artificial and human intelligence, and maps these elements against issues in both evaluation and explanation, showing how the two are related. We consider a number of common PSD application patterns in the light of our model, and identify a set of key issues connected to explanation and evaluation in each case. Finally, we propose multiple strategies to promote wider adoption of AI/ML technologies in PSD, where each is distinguished by a focus on different elements of our model, allowing PSD policy makers to adopt an approach that best fits their context and concerns.

研究动机与目标

  • 解决公共部门决策(PSD)中人工智能系统评估的长期挑战,其中技术复杂性和社会技术嵌入性使验证与确认变得复杂。
  • 阐明解释与评估在人工智能/机器学习系统中的相互依赖关系,特别是在深度学习模型不透明的背景下。
  • 开发一个人机决策循环的结构化模型,识别关键的失败点与解释和评估的机会点。
  • 提出四种不同的策略——使命导向、数据导向、工作导向和证据导向——供公共部门组织根据其特定优先事项和约束采纳人工智能。
  • 通过将评估建立在现实世界影响而非仅模型准确率的基础上,并强调反馈与学习回路,推动可持续、可信的人工智能采纳。

提出的方法

  • 基于博伊德的OODA循环,开发一个人机决策循环的概念模型,区分数据要素(输入、训练、反馈)和操作要素(观察、调整、决策、行动)。
  • 将评估(验证与确认)和解释(如何?为何?)映射到决策循环的特定组件,识别出最需要审查的环节。
  • 提出公共部门决策中人工智能部署的四种不同策略:使命导向(关注结果)、数据导向(关注数据质量和管理)、工作导向(关注人机协作)和评估导向(整体性、基于证据的方法)。
  • 运用该框架分析常见的公共部门决策应用模式,识别每种模式下解释与评估的关键问题。
  • 整合单环、双环和三环学习的概念,强调通过反馈和基于证据的验证实现迭代改进。
  • 借鉴人工智能寒冬的历史教训,主张长期成功取决于实际影响的实证证据,而非仅技术性能。

实验结果

研究问题

  • RQ1如何系统性地将人工智能/机器学习系统在公共部门决策中的评估与解释联系起来,以提升信任度与问责制?
  • RQ2在公共部门人工智能应用中,验证(‘正确构建系统’)与确认(‘构建正确的系统’)的解释需求之间存在哪些关键差异?
  • RQ3所提出的四种策略——使命导向、数据导向、工作导向和证据导向——在关注点和对人工智能评估与解释的影响方面有何不同?
  • RQ4公共部门组织中的社会技术过程如何使人工智能系统影响的评估复杂化,又该如何应对?
  • RQ5反馈回路与基于证据的评估如何帮助克服人工智能炒作风险,确保公共部门中可持续、高影响力的AI部署?

主要发现

  • 解释与评估密不可分:有效的解释有助于支持验证(如调试)和确认(如建立信任),尤其在复杂的社会技术系统中。
  • 使命导向策略优先关注决策、行动和反馈数据,将解释聚焦于‘为何’结果成功或失败,从而将人工智能表现与现实世界影响联系起来。
  • 数据导向策略通过提升数据质量和管理来增强评估,将责任重心转向验证,并增加系统中的‘已知的已知’。
  • 工作导向策略通过优化人与AI之间的劳动分工,提升系统稳健性与工作满意度,其中解释在建立信任与问责制方面发挥关键作用。
  • 评估导向策略提供一种整体性、基于证据的方法,捕捉整个决策循环中‘什么有效’,支持长期学习与制度记忆。
  • 反馈回路——尤其是三环学习——对于使人工智能系统适应新情境、缓解‘已知的未知’和‘未知的未知’风险至关重要,确保其影响超越初始性能指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。