[论文解读] Deep Argumentative Explanations
本文提出了深度论辩解释(DAXs),这是一种新颖的框架,通过将神经网络中的神经元及其相互作用建模为具有辩证关系(支持/攻击)的论辩,利用计算论辩来生成可解释的、分层的解释。DAXs在保持与模型内部高度一致的同时,计算成本低,并且在可理解性与人类判断的一致性方面显著优于LIME和SHAP,尤其在增强对模型推理过程的信任感与洞察力方面表现突出。
Despite the recent, widespread focus on eXplainable AI (XAI), explanations computed by XAI methods tend to provide little insight into the functioning of Neural Networks (NNs). We propose a novel framework for obtaining (local) explanations from NNs while providing transparency about their inner workings, and show how to deploy it for various neural architectures and tasks. We refer to our novel explanations collectively as Deep Argumentative eXplanations (DAXs in short), given that they reflect the deep structure of the underlying NNs and that they are defined in terms of notions from computational argumentation, a form of symbolic AI offering useful reasoning abstractions for explanation. We evaluate DAXs empirically showing that they exhibit deep fidelity and low computational cost. We also conduct human experiments indicating that DAXs are comprehensible to humans and align with their judgement, while also being competitive, in terms of user acceptance, with some existing approaches to XAI that also have an argumentative spirit.
研究动机与目标
- 为解决现有可解释人工智能(XAI)方法缺乏透明度的问题,这些方法往往仅关注输入-输出影响,而未揭示内部推理结构。
- 通过将神经网络组件建模为具有辩证关系的论辩,弥合符号人工智能(计算论辩)与深度学习之间的鸿沟。
- 开发一种框架,生成反映神经网络深层、分层推理过程的解释,而非仅呈现扁平化的特征重要性。
- 通过实证评估DAXs的保真度、效率与人类可理解性,将其与LIME和SHAP等成熟XAI方法进行比较。
- 验证DAXs是否与人类判断一致,并且是否被感知为比扁平化解释更具洞察力和可信度。
提出的方法
- DAXs通过从训练好的神经网络中提取广义论辩框架(GAF)生成,其中神经元或神经元组被视为论辩。
- 基于激活模式和相关性传播(例如使用LRP)定义论辩之间的辩证关系(支持与攻击)。
- 论辩的辩证强度由量化度量(例如LRP得分)推导得出,确保与模型行为一致,并满足关键的辩证属性。
- 该框架支持多种解释形式,包括对话式和结构化形式,通过参数χ适配用户认知需求。
- 在不同架构(如用于文本的CNN)上实现了三个DAX实例,采用不同的GAF及源自底层模型输出的语义。
- 通过自动化指标(深度保真度、复杂度)和人类研究相结合的方式评估解释,后者用于衡量可理解性、一致性与信任度。
实验结果
研究问题
- RQ1DAXs是否准确反映神经网络的深层内部结构,从而确保与模型推理过程的高保真度?
- RQ2DAXs是否在提供丰富、分层解释的同时保持低计算复杂度?
- RQ3DAXs中中间论辩与预测类别之间的支持关系是否与人类判断一致?
- RQ4DAXs中单个词语与中间论辩之间的支持关系是否与人类判断一致?
- RQ5在用户研究中,DAXs是否比LIME和SHAP更能激发信任并提供更好的洞察力?
主要发现
- DAXs展现出深度保真度,即其内部论辩结构能准确反映底层神经网络的推理过程。
- DAXs表现出低计算复杂度,使其在各类神经网络架构中均具备高效部署的潜力。
- 在RQ4中,96.0% ± 0.4%的参与者正确选出了由n-gram支持的类别,证实了对中间论辩支持的人类判断一致性。
- 在RQ5中,85.0% ± 0.7%的参与者正确识别出最强支持或攻击性词语,验证了DAX支持关系的语义合理性。
- DAXs在揭示CNN内部工作机制方面显著优于LIME和SHAP(p < 0.004 和 p < 0.006,分别)
- DAXs显著提升了用户信任度,优于SHAP(p < 0.002),但与LIME相比的信任优势未达统计显著性(p = 0.32),可能与参与者专业水平有关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。