[论文解读] Attribution-based XAI Methods in Computer Vision: A Review
本文对计算机视觉中的基于归因的可解释人工智能(XAI)方法进行了全面综述,将这些方法分类为基于梯度的方法、基于扰动的方法和对比方法。文章评估了它们的优势、局限性和可靠性,指出了诸如对输入变化敏感和在合理性检查中失败等关键缺陷,同时倡导开发更稳健的评估基准和可解释性更强的模型,而非依赖脆弱的后处理解释。
The advancements in deep learning-based methods for visual perception tasks have seen astounding growth in the last decade, with widespread adoption in a plethora of application areas from autonomous driving to clinical decision support systems. Despite their impressive performance, these deep learning-based models remain fairly opaque in their decision-making process, making their deployment in human-critical tasks a risky endeavor. This in turn makes understanding the decisions made by these models crucial for their reliable deployment. Explainable AI (XAI) methods attempt to address this by offering explanations for such black-box deep learning methods. In this paper, we provide a comprehensive survey of attribution-based XAI methods in computer vision and review the existing literature for gradient-based, perturbation-based, and contrastive methods for XAI, and provide insights on the key challenges in developing and evaluating robust XAI methods.
研究动机与目标
- 提供计算机视觉中基于归因的XAI方法的全面调查,重点关注基于梯度的方法、基于扰动的方法和对比方法。
- 分析现有XAI方法在解释深度卷积神经网络(CNN)预测时的优势、劣势和权衡。
- 通过对其对输入扰动和参数随机化的鲁棒性进行批判性评估,研究当前XAI方法的可靠性和有效性。
- 强调后处理解释方法在提供高风险应用场景中模型决策有意义洞察方面的局限性。
- 倡导改进评估基准,并推动开发本质上可解释的模型,而非依赖脆弱的后处理解释。
提出的方法
- 将基于归因的XAI方法分为三大类:基于梯度的方法(如Grad-CAM、Integrated Gradients)、基于扰动的方法(如遮挡敏感性)和对比方法(如Score-CAM、FullGrad)。
- 回顾核心技术,如引导反向传播、Grad-CAM和Integrated Gradients,这些方法通过反向传播梯度或对输入插值进行积分来计算特征归因。
- 使用定性和定量指标评估方法,包括保真度、一致性以及对输入扰动的鲁棒性。
- 通过随机化模型参数和数据实施“合理性检查”,以测试解释是否依赖于学习到的权重,或是否为虚假结果。
- 通过像素掩蔽基准测试——将高归因像素替换为随机值——评估解释是否与模型性能下降一致。
- 分析输入偏移和不可察觉的扰动对解释稳定性的影响,揭示了Integrated Gradients和Deep Taylor分解等方法的脆弱性。
实验结果
研究问题
- RQ1基于梯度的方法、基于扰动的方法和对比方法在为深度卷积神经网络的输入特征分配重要性时有何不同?
- RQ2现有XAI方法在多大程度上对输入扰动、参数随机化和输入偏移具有鲁棒性?
- RQ3当前XAI方法能否可靠地识别出图像中真正决定决策的区域,还是会产生误导性的解释?
- RQ4后处理解释方法在提供对深度学习模型行为有意义洞察方面存在哪些关键局限性?
- RQ5是否存在一条可行路径,可实现本质上可解释的模型,从而减少对脆弱的后处理解释技术的依赖?
主要发现
- 许多广泛使用的XAI方法,包括引导反向传播和引导Grad-CAM,未能通过基本的合理性检查,表明其结果与模型参数和训练数据无关。
- 显著性图可被不可察觉的图像扰动操纵,而模型预测保持不变,这表明其不可靠。
- 像Integrated Gradients和Deep Taylor分解这样的方法对输入偏移不具有不变性,可通过简单的输入变换生成欺骗性解释。
- 当移除XAI方法识别出的高归因像素时,模型性能显著下降,这在某些情况下验证了其保真度,但前提是必须确保鲁棒性。
- 显著性图与人类感知之间存在根本性脱节,因为模型关注的图像区域往往与人类不同。
- 可解释性与准确率之间的权衡是一种误解——提高可解释性反而可以提升模型性能,这表明应优先发展本质上可解释的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。