[论文解读] A Bayesian Account of Measures of Interpretability in Human-AI Interaction
本文提出了一套统一的贝叶斯框架,将三种关键可解释性度量——可读性、可解释性和可预测性——整合到一个基于人类信念更新的统一模型中。通过将人类的心理状态建模为对多个智能体模型的不确定性概率信念,该框架解决了现有可解释性度量之间的冲突,并解释了用户研究中观察到的新行为现象。
Existing approaches for the design of interpretable agent behavior consider different measures of interpretability in isolation. In this paper we posit that, in the design and deployment of human-aware agents in the real world, notions of interpretability are just some among many considerations; and the techniques developed in isolation lack two key properties to be useful when considered together: they need to be able to 1) deal with their mutually competing properties; and 2) an open world where the human is not just there to interpret behavior in one specific form. To this end, we consider three well-known instances of interpretable behavior studied in existing literature -- namely, explicability, legibility, and predictability -- and propose a revised model where all these behaviors can be meaningfully modeled together. We will highlight interesting consequences of this unified model and motivate, through results of a user study, why this revision is necessary.
研究动机与目标
- 解决现有可解释性度量——可读性、可解释性和可预测性——之间缺乏整合的问题,这些度量此前均被孤立研究。
- 解决这些度量之间的根本不相容性,其根源在于对人类观察者心理模型和信念结构的假设存在冲突。
- 开发一个统一模型,将可解释性理解为一种贝叶斯推理过程,同时考虑人类对其智能体模型信念中的不确定性。
- 通过用户研究验证该框架,证明其能够预测先前模型无法捕捉的行为。
- 实现未来规划与沟通策略,以在现实世界的人机协作中联合优化多种可解释性属性。
提出的方法
- 将人类观察者的信念状态建模为对多个智能体模型的概率分布,包括一个空模型(M⁰),用于表示不确定性或对故障的信念。
- 在单一贝叶斯推理框架内制定所有三种可解释性度量——可读性、可解释性和可预测性——其中观察者根据观察到的智能体行为来更新信念。
- 引入对“犯错信念”的关键作用(即对M⁰存在非零先验),作为实现竞争性可解释性属性兼容性的统一机制。
- 使用模型后验概率来定义可解释性:对真实模型的后验置信度越高,表示可解释性越好。
- 将每种可解释性度量映射到信念更新过程中的特定现象:可读性作为模型识别,可解释性作为与期望的一致性,可预测性作为计划预判。
- 利用反映人类认知局限性的似然函数,使抽象化和简化解释得以应用,从而提升可解释性。
实验结果
研究问题
- RQ1如何在单一可解释性框架下有意义地统一可读性、可解释性和可预测性?
- RQ2人类对其智能体模型可能出错的信念在实现可解释性度量之间的兼容性中起到什么作用?
- RQ3所提出的贝叶斯框架能否预测先前模型未捕捉到的新行为现象?
- RQ4现有可解释性表述中冲突的假设(例如单假设与多假设)如何影响其共存?
- RQ5沟通与解释在何种方式下可被正式整合进该框架,以同时增强多种可解释性属性?
主要发现
- 所提出的贝叶斯框架通过将人类信念状态建模为对多个智能体模型(包括对真实模型的不确定性)的概率分布,成功统一了可读性、可解释性和可预测性。
- 在空模型(M⁰)上引入非零先验,解决了可解释性度量之间的不相容性,解释了为何先前看似可读的行为在不确定性下可能变得难以解释或不可读。
- 用户研究验证了该框架能够预测新颖的行为属性,例如当智能体表明意图时,人类对次优行为的容忍度提高,这些属性此前未被孤立模型捕捉。
- 该框架解释了为何当人类观察者认为智能体正努力提高可读性时,可能接受次优行为,这是由于当观察者怀疑自身模型有误时,对模糊性的容忍度更高。
- 该模型使智能体能够根据观察者的当前信念状态动态平衡可解释性属性,而非孤立地优化某一指标。
- 该重构使得解释策略(如抽象化和因果链)可被整合进似然函数中,从而在保持与可预测性和可读性一致的同时提升可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。