[论文解读] The Value of Measuring Trust in AI - A Socio-Technical System Perspective
本文提出一种社会技术系统视角,以克服现有AI信任度量方法的局限性,引入两种方法:(1) 对系统内所有交互中的信任进行聚合;(2) 转向实用型构建,如批判性反馈、协商与团队认知。其核心贡献是一个基于现实动态而非抽象数值信任分的框架,用于设计更可靠、更具情境感知的人机协作。
Building trust in AI-based systems is deemed critical for their adoption and appropriate use. Recent research has thus attempted to evaluate how various attributes of these systems affect user trust. However, limitations regarding the definition and measurement of trust in AI have hampered progress in the field, leading to results that are inconsistent or difficult to compare. In this work, we provide an overview of the main limitations in defining and measuring trust in AI. We focus on the attempt of giving trust in AI a numerical value and its utility in informing the design of real-world human-AI interactions. Taking a socio-technical system perspective on AI, we explore two distinct approaches to tackle these challenges. We provide actionable recommendations on how these approaches can be implemented in practice and inform the design of human-AI interactions. We thereby aim to provide a starting point for researchers and designers to re-evaluate the current focus on trust in AI, improving the alignment between what empirical research paradigms may offer and the expectations of real-world human-AI interactions.
研究动机与目标
- 解决由于定义模糊和实证环境有限导致的AI信任度量不一致问题。
- 弥合信任实证研究与现实世界人机交互期望之间的差距。
- 提出一种社会技术系统视角,更好地反映实际AI部署中复杂且动态的互动。
- 将关注点从量化单一的“信任分”转向评估诸如批判性反馈与团队认知等促成性构建。
- 提供与实际互动动态一致的设计导向型度量方法,具有可操作性。
提出的方法
- 采用社会技术系统视角,将AI建模为嵌入在相互关联的人工与技术组件中的系统。
- 提出一种建构主义方法:将信任视为系统内所有交互中信任水平的聚合。
- 引入范式转变方法:以可度量的构建(如批判性反馈、协商与团队认知)替代抽象的信任度量。
- 利用现实场景(如临床医生-AI-患者二元组)来操作化诸如理由说明、反馈回路与信心变化等构建。
- 通过时间至达成一致、交互次数以及用户信心变化等指标来度量交互质量。
- 整合诸如共同基础与团队认知等构建,以评估人机团队中的共享理解与协作表现。
实验结果
研究问题
- RQ1当现有方法依赖于不一致的定义和单一数值分数时,如何有意义地度量AI中的信任?
- RQ2将AI视为社会技术系统,如何提升实证研究与现实部署情境之间的契合度?
- RQ3哪些可度量的、基于交互的构建可以替代抽象的信任指标,以更好地指导AI设计?
- RQ4批判性反馈、协商与团队认知等构建如何促进更可靠的人机协作?
- RQ5人类中介(如临床医生)在人机二元组中发挥何种作用,以塑造信任与理解?
主要发现
- 现有AI信任度量受限于术语不一致、实验室环境过于简化,以及依赖与行为结果不一致的自报问卷。
- 试图为AI信任赋予单一数值的做法,无法捕捉现实互动的复杂性,且限制了设计的适用性。
- 度量批判性反馈(如患者对AI预测的反馈)可作为信任促成的切实、可度量的代理指标,包括解决时间与信心变化。
- 协商、共同基础与团队认知等构建,为人机团队中提供了比抽象信任分更具可操作性与情境敏感性的替代方案。
- 临床医生在临床医生-AI-患者互动中的中介角色显著影响信任校准与结果接受度,凸显了在设计中建模此类角色的必要性。
- 通过既定逻辑对交互中的信任进行聚合,为系统级信任度量提供了可行路径,前提是采用一致的测量方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。