[论文解读] When a Relation Tells More Than a Concept: Exploring and Evaluating Classifier Decisions with CoReX
本文提出 CoReX,一种用于卷积神经网络(CNN)的新型可解释人工智能方法,通过概念与关系推理解释模型决策,提升可解释性,超越像素级显著性。通过结合概念显著性与归纳逻辑编程(ILP)生成的逻辑规则,CoReX 生成忠实且对比性的解释,揭示概念间空间关系(如“喷嘴在把手右侧”)如何驱动分类决策,从而实现对复杂领域(如生物医学)中误分类的检测与模型评估。
Explanations for Convolutional Neural Networks (CNNs) based on relevance of input pixels might be too unspecific to evaluate which and how input features impact model decisions. Especially in complex real-world domains like biology, the presence of specific concepts and of relations between concepts might be discriminating between classes. Pixel relevance is not expressive enough to convey this type of information. In consequence, model evaluation is limited and relevant aspects present in the data and influencing the model decisions might be overlooked. This work presents a novel method to explain and evaluate CNN models, which uses a concept- and relation-based explainer (CoReX). It explains the predictive behavior of a model on a set of images by masking (ir-)relevant concepts from the decision-making process and by constraining relations in a learned interpretable surrogate model. We test our approach with several image data sets and CNN architectures. Results show that CoReX explanations are faithful to the CNN model in terms of predictive outcomes. We further demonstrate through a human evaluation that CoReX is a suitable tool for generating combined explanations that help assessing the classification quality of CNNs. We further show that CoReX supports the identification and re-classification of incorrect or ambiguous classifications.
研究动机与目标
- 解决像素级解释在捕捉复杂图像分类任务中关键的高层、关系特征方面的局限性。
- 通过识别影响预测的概念与关系,改进模型评估,特别是在模糊或边界情况中。
- 通过允许用户指定应抑制或强调的概念或关系,支持交互式模型修正。
- 开发一种结合概念激活显著性与基于逻辑的推理方法,实现更可解释且忠实的解释。
- 通过关系知识,展示对比性解释(对比相似但分类不同的图像)的实用性。
提出的方法
- CoReX 使用概念显著性传播在中间 CNN 特征中识别并定位概念,根据其对分类的贡献分配正、负或中性得分。
- 通过聚类高显著性像素组并用自然语言术语(如“把手”、“喷嘴”)标注,提取有意义的概念。
- 利用归纳逻辑编程(ILP)建立空间与结构关系(如“喷嘴在把手右侧”),学习可解释的逻辑规则。
- 基于学习到的 ILP 理论构建代理模型,通过屏蔽无关概念并强制执行关系约束来约束预测。
- 通过对比样本与来自对比类别的反事实样本生成解释,突出区分性关系。
- 该方法支持交互式反馈:用户可修改规则以纠正误分类,实现通过人机协同实现的模型正则化。

实验结果
研究问题
- RQ1基于概念与关系的解释是否能揭示像素级解释所遗漏的判别性特征,特别是在复杂图像分类任务中?
- RQ2CoReX 的解释在多大程度上忠实反映已训练 CNN 的实际决策过程?
- RQ3CoReX 是否能识别并解释误分类,通过突出错误或模糊的概念关系?
- RQ4用户在多大程度上可借助 CoReX 通过交互式规则修改纠正模型行为?
- RQ5在真实世界领域(如生物医学或细粒度视觉分类)中,关系知识的引入是否能提升 CNN 决策的可解释性与可评估性?
主要发现
- CoReX 的解释在多个数据集和网络架构上均表现出高度忠实性,经预测一致性验证。
- 该方法成功识别出区分性关系(如“喷嘴在把手右侧”),可有效区分“茶壶”与“广口瓶”等类别,而像素级方法无法表达此类关系。
- 在 Adience 数据集中,CoReX 发现由关系“眼睛在微笑的嘴上方”定义的代表性聚类,展示了其捕捉细微面部结构模式的能力。
- 在 Picasso 数据集中,CoReX 发现误分类的男性面部因背景伪影未被规则覆盖,揭示了模型对虚假特征的敏感性。
- 通过修改规则,该方法实现了对误分类的交互式修正,展示了人机协同模型优化的潜力。
- Adience 评估中一个空聚类暴露了一个未被任何规则覆盖的误分类男性样本,凸显了该方法识别需人工审查问题样本的能力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。