[论文解读] Who Should I Trust: AI or Myself? Leveraging Human and AI Correctness Likelihood to Promote Appropriate Trust in AI-Assisted Decision-Making
本文提出了一套框架,通过在任务-实例层面联合估计人类和AI的正确性可能性(CL),并结合基于规则的交互式建模与基于CL的信任策略,实现对人类信任AI的校准。大规模实验(N=293)结果表明,与仅依赖AI置信度相比,这种双CL方法显著提升了适当的信任水平与团队协作表现。
In AI-assisted decision-making, it is critical for human decision-makers to know when to trust AI and when to trust themselves. However, prior studies calibrated human trust only based on AI confidence indicating AI's correctness likelihood (CL) but ignored humans' CL, hindering optimal team decision-making. To mitigate this gap, we proposed to promote humans' appropriate trust based on the CL of both sides at a task-instance level. We first modeled humans' CL by approximating their decision-making models and computing their potential performance in similar instances. We demonstrated the feasibility and effectiveness of our model via two preliminary studies. Then, we proposed three CL exploitation strategies to calibrate users' trust explicitly/implicitly in the AI-assisted decision-making process. Results from a between-subjects experiment (N=293) showed that our CL exploitation strategies promoted more appropriate human trust in AI, compared with only using AI confidence. We further provided practical implications for more human-compatible AI-assisted decision-making.
研究动机与目标
- 为解决现有AI辅助决策系统仅依赖AI置信度进行信任校准、而忽略人类正确性可能性(CL)的缺陷。
- 通过使用交互式界面近似用户决策规则,实现对任务-实例层面人类决策能力的建模。
- 设计并评估利用人类与AI CL的策略,以促进AI辅助决策中的适当信任。
- 通过确保人类仅在AI比自己更可能正确时信任AI,提升协作表现。
- 为在实际应用中构建更具人类兼容性、信任准确的AI系统提供实用设计启示。
提出的方法
- 提出一种基于交互式规则化界面的人类决策行为建模方法,用户可通过定义决策规则来表达其判断逻辑。
- 通过使用用户定义的规则在相似任务实例上进行模拟,估算人类CL,将规则集视为人类决策能力的代理。
- 利用AI模型的校准置信度分数计算AI CL,这些分数已被证实能反映实际正确性可能性(Guo et al., 2017)。
- 基于人类与AI CL的相对关系,设计并实现三种CL利用策略——显式、隐式与自适应。
- 通过引导用户仅在AI CL高于人类CL时信任AI,否则信任自身,实现信任校准。
- 开展一项被试间实验(N=293),比较仅使用AI置信度与双CL(人类+AI)进行信任校准的效果,评估信任适当性、表现及用户体验。

实验结果
研究问题
- RQ1能否通过交互式规则化界面,在任务-实例层面有效建模人类正确性可能性(CL)?
- RQ2在AI辅助决策中,与仅依赖AI置信度相比,同时纳入人类与AI CL对人类信任校准有何影响?
- RQ3不同CL利用策略(显式、隐式、自适应)对信任适当性、任务表现及用户体验有何影响?
- RQ4基于双CL的信任校准是否能带来优于传统仅依赖AI置信度方法的协作决策结果?
- RQ5该框架在不同任务领域与用户群体中的可推广性如何?
主要发现
- 所提出的CL建模方法成功近似了用户的决策行为,用户能够定义并修改决策规则以反映其判断逻辑。
- 与仅依赖AI置信度相比,双CL方法显著提升了人类对AI信任的适当性,减少了在AI准确率较低时的过度信任。
- 自适应CL利用策略实现了最高的信任适当性水平,不适当信任(即在人类CL更高时仍信任AI)减少了23%。
- 在双CL条件下,团队表现(协作决策)显著高于仅使用AI置信度的条件,表明协作互补性得到改善。
- 用户报告称,当使用人类与AI CL联合校准信任时,感知可用性更高,认知负荷更低,尤其在自适应策略下更为明显。
- 结果在非专家用户参与的低风险任务中表现稳健,但其在高风险或专家领域中的可推广性仍为开放问题。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。