[论文解读] Natural Language Interaction with Explainable AI Models
本文提出了一种用于可解释人工智能(XAI)模型的自然语言交互框架,该框架以有向无环图(AOG)解析图作为输入,生成人类可理解的解释。该框架将用户问题分类为10种对比类型,并采用三种推理类型——直接证据、基于部分的推理和上下文推理——通过一个新标注的数据集表明,话语和常识性解释最受用户青睐。
This paper presents an explainable AI (XAI) system that provides explanations for its predictions. The system consists of two key components -- namely, the prediction And-Or graph (AOG) model for recognizing and localizing concepts of interest in input data, and the XAI model for providing explanations to the user about the AOG's predictions. In this work, we focus on the XAI model specified to interact with the user in natural language, whereas the AOG's predictions are considered given and represented by the corresponding parse graphs (pg's) of the AOG. Our XAI model takes pg's as input and provides answers to the user's questions using the following types of reasoning: direct evidence (e.g., detection scores), part-based inference (e.g., detected parts provide evidence for the concept asked), and other evidences from spatio-temporal context (e.g., constraints from the spatio-temporal surround). We identify several correlations between user's questions and the XAI answers using Youtube Action dataset.
研究动机与目标
- 开发一种自然语言交互系统,使用户能够以对话方式查询XAI模型对其预测的解释。
- 识别并分类用户问题为10种对比类型,以更好地理解用户在XAI交互中的意图。
- 评估不同问题类型下,哪些解释类型(如直接证据、基于部分的推理或话语推理)最受用户欢迎。
- 创建一个全新的标注解释数据集,包含来自YouTube Action数据集的550对问题-解释,以支持对解释偏好进行实证分析。
提出的方法
- 使用有向无环图(AOG)解析图(pgs)作为输入,表示视觉模型的预测结果,捕捉分层和组合的视觉概念。
- 将用户问题分类为10种子对比类别(例如,WH-X、WH-X-NOT-Y、NOT-X),以建模用户隐含的比较行为。
- 使用三种推理类型生成解释:(1) 直接证据(例如,检测得分),(2) 基于部分的推理(例如,肢体姿态支持‘坐’的预测),(3) 上下文推理(例如,话语关系、常识、反事实推理)。
- 使用来自YouTube Action数据集的55个领域,标注了一个包含550对问题-解释的全新数据集,由25名研究生和30名本科生标注用户偏好的解释类型。
- 采用多标签标注方案,每道问题可关联最多五种解释类型,支持对偏好模式的统计分析。
- 通过不同问题类型下解释类型的百分比分布分析用户偏好模式,揭示出话语和常识推理受青睐的显著趋势。
实验结果
研究问题
- RQ1用户在向XAI模型寻求解释时,最常提出哪些对比类型的问题?
- RQ2对于不同问题类别,用户最偏好哪种解释类型——直接证据、基于部分的推理,还是上下文推理?
- RQ3话语关系和常识推理在用户对解释质量的感知中起到何种影响?
- RQ4问题类型与人类交互式XAI系统中用户偏好的解释格式之间存在何种相关性?
- RQ5对话历史如何影响多轮交互中解释类型的选取?
主要发现
- 对于WH-X问题(例如,'为什么这个人是坐着的?'),尽管问题本身简单,仍有46.2%的用户偏好Gamma型解释(自上而下的上下文推理),表明即使在基础查询中,用户也强烈偏好上下文解释。
- 对于WH-X-NOT-Y问题(例如,'为什么是坐着而不是站着?'),36.5%的用户偏好Alpha解释(直接证据),34.6%偏好Gamma解释,表明用户在证据与上下文之间存在明显偏好分歧。
- 话语类解释整体最受欢迎,DO-X-NOT-Y问题中高达81.4%的响应选择了此类解释,表明用户高度重视概念之间的关系连贯性。
- 常识推理是第二受欢迎的解释类型,在DO-NOT-X问题中被选择69.3%,在WH-NOT-Y问题中为50.1%,凸显了世界知识在解释缺失或否定现象中的重要性。
- 基于AOG的Alpha、Beta和Gamma解释组合占所有标注的30%以上,证实结构化视觉推理在XAI解释中有效且相关。
- 数据集分析显示,WH-X1-NOT-X2问题(涉及多个实例)中46.6%的响应为话语类解释,表明在比较多个实体时,关系推理至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。