[论文解读] Are we measuring trust correctly in explainability, interpretability, and transparency research?
本文批判了当前衡量可解释性、可理解性与透明度(XIT)研究中信任的现有方法,认为依赖自我报告的信任量表无法捕捉信任是否与模型质量相匹配。本文提出通过行为任务来衡量实际信任,并操纵模型的可信度,以评估XIT方法是否提升了校准后的信任。文章提出了三种实用的评估方法,以推动人类-人工智能交互研究中更严谨、基于行为的信任测量。
This paper presents an argument for why we are not measuring trust sufficiently in explainability, interpretability, and transparency research. Most studies ask participants to complete a trust scale to rate their trust of a model that has been explained/interpreted. If the trust is increased, we consider this a positive. However, there are two issues with this. First, we usually have no way of knowing whether participants should trust the model. Trust should surely decrease if a model is of poor quality. Second, these scales measure perceived trust rather than demonstrated trust. This paper showcases three methods that do a good job at measuring perceived and demonstrated trust. It is intended to be starting point for discussion on this topic, rather than to be the final say. The author invites critique and discussion.
研究动机与目标
- 强调当前XIT研究中仅依赖自我报告信任量表而未验证信任是否与模型实际可信度相匹配的缺陷。
- 主张仅测量感知信任(自我报告)是不够的,必须同时测量实际表现的信任(行为选择),以评估XIT方法是否带来恰当校准的信任。
- 提出一种评估XIT干预措施的框架,通过操纵底层模型的可信度,测量XIT方法是否提升了感知信任与实际模型可靠性之间的一致性。
- 鼓励开展纵向研究,追踪信任随时间的变化,而非依赖单次评估。
- 发起整个社区对改进XIT研究中信任评估方法的讨论,强调方法严谨性以及与模型质量校准的必要性。
提出的方法
- 使用行为信任任务(如信任坠落游戏或经济博弈),让参与者决定是否将任务委托给AI,从而通过行动表现信任。
- 通过改变模型的准确率或可靠性等实际可信度,创造信任应随模型质量上升或下降的情境。
- 结合感知信任(通过标准化李克特量表调查)与实际表现的信任(通过行为决策),评估XIT方法是否提升了感知与现实之间的一致性。
- 应用现有的信任测量工具(如IMPACTS模型、Jian等人信任检查表),但将其置于系统性地改变模型可信度的受控实验设计中。
- 整合激励性决策任务(如真实金钱奖励),以提高生态效度并减少信任报告中的响应偏差。
- 设计纵向研究,追踪信任随时间的变化,评估XIT方法对信任校准与依赖行为的长期影响。
实验结果
研究问题
- RQ1当前的XIT评估方法在多大程度上衡量了校准信任(即信任与模型实际可信度一致)?
- RQ2在XIT研究中,如何可靠地测量实际表现的信任?哪些行为任务最能捕捉这一构念?
- RQ3通过操纵模型的实际可信度,能否帮助判断XIT方法是否改善了感知信任与实际信任之间的一致性?
- RQ4自我报告信任量表在XIT研究中的局限性是什么?它们为何无法捕捉对AI系统的过度或不足依赖?
- RQ5纵向评估设计如何能增进我们对人类-AI团队中信任动态的理解,特别是对XIT干预的响应?
主要发现
- 大多数当前的XIT研究未能衡量信任是否与模型质量相匹配,因为它们仅依赖自我报告而未验证模型的可靠性。
- 仅靠感知信任量表无法判断信任是否恰当——参与者可能因误导性解释而信任低质量模型,而这种缺陷无法通过调查捕捉。
- 通过行为任务(如委托决策)体现的实际信任,比自我报告更能有效衡量真实世界中的信任行为。
- 本文证明,信任评估必须包含对模型可信度的操纵,以评估XIT方法是否真正提升了校准效果——例如,解释是否仅在可信模型上增加了信任?
- 现有方法如信任坠落游戏和激励性经济博弈在测量实际表现的信任方面是有效的,应整合进XIT评估框架。
- 本文结论认为,当前的评估实践不足,呼吁向基于行为、注重校准的信任测量转变,尤其在纵向研究环境中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。