[论文解读] Do Humans Trust Advice More if it Comes from AI? An Analysis of Human-AI Interactions
本文提出了一种两阶段的'激活-整合'模型,解释人类如何决定是否使用AI建议以及如何将其纳入决策中,发现来源(AI与人类)影响激活阶段但不影响整合阶段——信任主要由感知性能驱动,而非来源类型。该模型在多种任务和人群中均成立,包括皮肤科医生。
In decision support applications of AI, the AI algorithm's output is framed as a suggestion to a human user. The user may ignore this advice or take it into consideration to modify their decision. With the increasing prevalence of such human-AI interactions, it is important to understand how users react to AI advice. In this paper, we recruited over 1100 crowdworkers to characterize how humans use AI suggestions relative to equivalent suggestions from a group of peer humans across several experimental settings. We find that participants' beliefs about how human versus AI performance on a given task affects whether they heed the advice. When participants do heed the advice, they use it similarly for human and AI suggestions. Based on these results, we propose a two-stage, "activation-integration" model for human behavior and use it to characterize the factors that affect human-AI interactions.
研究动机与目标
- 理解人类在决策情境中如何使用AI建议与人类建议。
- 识别影响个体是否激活(使用)或整合(纳入)来自AI与人类来源建议的因素。
- 在多种任务和人群(包括普通民众和医学专家)中验证人机交互的两阶段模型。
- 量化人口统计特征、任务特异性因素及信念因素在建议利用中的作用。
- 发布收集的数据以供广泛研究使用,并探讨可操纵的人工智能信任的伦理影响。
提出的方法
- 采用法官-顾问范式(JAS)在多个实验设置中比较个体对AI与人类同龄人建议的反应。
- 设计了三种数据模态的实验:图像分类、讽刺检测和表格数据预测,涉及超过1100名众包工作者和37名皮肤科医生。
- 提出两阶段的'激活-整合'模型:首先,个体决定是否使用建议(激活);其次,他们更新自己的判断(整合)。
- 使用逻辑回归和线性回归模型估计置信度、一致性、先验信念和暴露程度等预测变量的系数。
- 在不同地理区域(美国、英国、亚洲)和任务类型中验证该模型,包括现实世界中的医疗决策。
- 收集并发布了匿名数据集以供公众再利用,确保医学任务中获得IRB批准的伦理数据实践。
实验结果
研究问题
- RQ1建议的来源(AI与人类)是否会影响个体选择使用它的可能性?
- RQ2一旦决定使用建议,个体在多大程度上以不同方式整合AI建议与人类建议?
- RQ3哪些因素(如置信度、一致性或先验信念)可预测建议是否被激活或整合?
- RQ4激活-整合模型在不同任务、人群和数据模态中具有多大程度的普适性?
- RQ5在现实决策情境中,AI使用经验或临床专业知识在多大程度上影响建议的利用?
主要发现
- 当个体认为建议来源(AI或人类)具备能力时,更可能使用该建议,但一旦使用,建议来源类型对整合过程无显著影响。
- 激活阶段——即是否使用建议——受对AI与人类表现的先验信念影响,其中对AI表现的先验信念系数为负但不显著(β = -0.283,p = 0.427)。
- 在活检任务中,AI和人类建议均将准确率从约67.6%提升至约74.0%,激活率分别为29.7%和29.8%,无显著差异。
- 整合阶段基本不受建议来源影响:AI建议在反应变化中的系数为-0.002(p = 0.427),表明建议的纳入方式无实质性差异。
- 反应置信度和与建议的一致性是激活的强预测因子,其中反应置信度具有显著负向影响(β = -0.531,p < 0.001)。
- 临床经验年限对激活有负向影响(β = -0.845,p = 0.048),表明经验越丰富的临床医生越少使用外部建议,尽管整合行为在不同经验水平间无显著差异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。