Skip to main content
QUICK REVIEW

[论文解读] The Many Facets of Trust in AI: Formalizing the Relation Between Trust and Fairness, Accountability, and Transparency

Bran Knowles, John T. Richards|arXiv (Cornell University)|Aug 1, 2022
Ethics and Social Impacts of AI被引用 8
一句话总结

本文提出一个形式化本体论,以厘清人工智能信任(TAI)的多维特性,区分主体(如用户、管理者、监管机构)、客体(如AI系统、机构)、基础(如可解释性、治理)、目标(如公平性、安全性)以及影响(如行为改变)。该研究揭示了在公平性、问责制与透明度(FAT)文献中对TAI概念化存在的不一致之处,并证明该本体论能够诊断概念性缺口,提升信任促进工作的连贯性。

ABSTRACT

Efforts to promote fairness, accountability, and transparency are assumed to be critical in fostering Trust in AI (TAI), but extant literature is frustratingly vague regarding this 'trust'. The lack of exposition on trust itself suggests that trust is commonly understood, uncomplicated, or even uninteresting. But is it? Our analysis of TAI publications reveals numerous orientations which differ in terms of who is doing the trusting (agent), in what (object), on the basis of what (basis), in order to what (objective), and why (impact). We develop an ontology that encapsulates these key axes of difference to a) illuminate seeming inconsistencies across the literature and b) more effectively manage a dizzying number of TAI considerations. We then reflect this ontology through a corpus of publications exploring fairness, accountability, and transparency to examine the variety of ways that TAI is considered within and between these approaches to promoting trust.

研究动机与目标

  • 通过识别并形式化AI文献中人工智能信任的多重维度,解决人工智能信任(TAI)领域概念不清的问题。
  • 解决在公平性、问责制与透明度(FAT)研究中关于信任讨论的不一致与错位问题。
  • 开发一个共享的分析框架,以厘清不同信任观念,促进更精确的论述与研究一致性。
  • 诊断FAT文献中发展不足或不连贯的信任正当化,特别是针对监管机构等主体及结构性信任。
  • 展示该本体论作为诊断与统一工具在人工智能伦理研究中的实用性。

提出的方法

  • 从学术、产业和新闻来源中构建了78篇关于TAI的文本语料,通过专家共识与迭代评审筛选。
  • 开发了一个包含五个轴的形式化本体论:主体(谁信任)、客体(被信任的对象)、基础(信任的依据)、目标(为何寻求信任)和影响(信任实现的功能)。
  • 将本体论作为分析视角,应用于第二个聚焦于FAT的出版物语料,以映射在公平性、问责制与透明度中信任的多样化概念化方式。
  • 采用定性编码与主题分析,识别不同研究领域中信任叙事的模式、遗漏与不一致之处。
  • 识别出三种典型叙事——用户信任、控制者信任与结构性信任——作为理解TAI话语的核心支柱。
  • 评估FAT文献中的修辞与概念连贯性,特别是信任目标与正当理由之间脱节的问题(如将信任作为目标,而将可解释性作为基础)。

实验结果

研究问题

  • RQ1信任在AI中的概念化在文献中如何不同?其在主体、客体、基础、目标与影响方面的关键差异轴是什么?
  • RQ2为何许多聚焦于FAT的论文未能将信任目标与其所选正当理由(如可解释性、治理)连贯地关联起来?
  • RQ3现有FAT研究在多大程度上反映了连贯的信任叙事?其中存在哪些关键缺口或不一致之处?
  • RQ4形式化本体论在多大程度上能统一并澄清分散的TAI话语,特别是与公平性、问责制与透明度的关系?
  • RQ5为何结构性信任——尤其是对机构与治理机制的信任——在当前的TAI与FAT研究中发展不足?

主要发现

  • 本体论成功揭示了人工智能信任并非单一概念,而是在主体(如用户、监管机构)、客体(如AI系统、机构)以及正当理由(如可解释性、治理)之间存在显著差异。
  • 许多聚焦于公平性的论文将‘获得信任’视为首要目标,但极少以一致的基础加以正当化,往往默认采用可解释性,却缺乏更深层次的对齐。
  • 问责制文献在很大程度上缺乏从监管机构或制度结构视角探讨信任,尽管在更广泛的TAI话语中已有此类信任的呼吁。
  • 许多论文在修辞上存在脱节:声称目标是建立信任,但实际提出的机制却依赖可解释性,而未解决结构性或制度性信任问题。
  • 三种典型叙事——用户信任、控制者信任与结构性信任——作为连贯且独立的路径浮现,有助于统一原本支离破碎的TAI话语讨论。
  • 本体论有效诊断出概念异常,例如制度治理在信任形成中的作用被弱化,同时指出了亟需进一步研究与提升连贯性的领域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。