Skip to main content
QUICK REVIEW

[论文解读] A Mental Model Based Theory of Trust

Zahra Zahedi, Sarath Sreedharan|arXiv (Cornell University)|Jan 29, 2023
Cognitive Science and Mapping被引用 5
一句话总结

该论文提出了一种基于心理模型的信任理论(MMbTT),通过用户对智能体能力与任务表现的认知模型和信念,形式化了人类对AI智能体的信任。通过人类被试实验,该理论在预测信任变化方面表现出高精度——尤其在任务特定组件(如能力、可靠性)方面,优于传统自评量表,更能捕捉信任的动态演变过程。

ABSTRACT

Handling trust is one of the core requirements for facilitating effective interaction between the human and the AI agent. Thus, any decision-making framework designed to work with humans must possess the ability to estimate and leverage human trust. In this paper, we propose a mental model based theory of trust that not only can be used to infer trust, thus providing an alternative to psychological or behavioral trust inference methods, but also can be used as a foundation for any trust-aware decision-making frameworks. First, we introduce what trust means according to our theory and then use the theory to define trust evolution, human reliance and decision making, and a formalization of the appropriate level of trust in the agent. Using human subject studies, we compare our theory against one of the most common trust scales (Muir scale) to evaluate 1) whether the observations from the human studies match our proposed theory and 2) what aspects of trust are more aligned with our proposed theory.

研究动机与目标

  • 开发一种在心理学上合理、计算上形式化的、关于人类对AI智能体信任的理论,以支持信任感知的决策制定。
  • 通过将信任建立在用户对智能体的心理模型基础上,弥补现有信任推断方法(如自评问卷和行为线索)的局限性。
  • 利用认知建模框架,形式化信任的演变过程、适当的信任水平以及人类对AI智能体的依赖程度。
  • 通过受控的人类被试实验,将该理论的预测能力与既有的信任量表(如Muir问卷)进行对比评估。
  • 为未来开发能够基于用户心理模型生成可解释行为与说明的信任感知AI系统奠定基础。

提出的方法

  • 将信任形式化为人类对AI智能体的心理模型($\mathbb{M}^{R}_{h}$)及其对最优任务表现的模型($\mathcal{M}^{*}_{h}$)的函数。
  • 基于智能体成功可能性的感知变化,建模信任的演变过程,通过更新智能体的模型($\mathcal{M}^{R}$)或提供解释来实现。
  • 将适当的信任水平定义为用户任务模型与智能体模型之间对齐程度的函数。
  • 采用计算框架推断信任水平,无需直接依赖自评,而是利用用户期望与智能体行为之间的一致性。
  • 通过受控的人类被试实验,对智能体成功可能性进行更新,测量各组件(能力、可预测性、可靠性、信念、总体信任)的信任变化。
  • 将MMbTT框架的预测结果与Muir信任量表的响应进行对比,以验证其准确性和与人类信任感知的一致性。

实验结果

研究问题

  • RQ1当AI智能体的感知可靠性被操纵时,基于心理模型的信任理论(MMbTT)在多大程度上能预测人类信任的变化?
  • RQ2MMbTT框架在测量信任各组成部分时,与既有的自评信任量表(如Muir问卷)的对齐程度如何?
  • RQ3哪些信任组成部分(如能力、可预测性、可靠性)最能被MMbTT框架准确预测?
  • RQ4为何某些信任组成部分(如可预测性)对信任更新的响应不一致?这对当前的信任测量工具意味着什么?
  • RQ5MMbTT框架能否作为设计信任感知AI系统的基石,使其能够根据用户心理模型自适应调整行为与解释?

主要发现

  • 在正向更新组中,总体信任显著增加(t(40) = -3.46, p < 0.001),支持了成功可能性提升会增强信任的假设。
  • 能力(t(40) = -4.09, p = 0.0001)、可靠性(t(40) = -3.85, p = 0.0002)、信念(t(40) = -2.919, p = 0.003)和总体信任(t(40) = -2.084, p = 0.02)等组件在正向更新后均显著上升。
  • 可预测性组件未表现出显著变化(t(40) = -0.63, p = 0.266),表明尽管成功可能性被更新,用户对机器人行为的不确定性仍保持不变。
  • 在负向更新组中,仅能力表现出显著下降(t(40) = -3.21, p = 0.001),而可预测性和总体信任等其他组件未见显著变化。
  • 尽管感知能力下降,总体信任未显著变化,表明当前的信任问卷可能无法完全捕捉动态信任的转变,尤其是在可预测性较高的情况下。
  • 结果表明,信任问卷应更具任务特异性,而非通用性,因为当问题与具体任务结果相关联时,用户信任的预测更为准确,而非基于抽象的智能体行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。