Skip to main content
QUICK REVIEW

[论文解读] Do Concept Bottleneck Models Learn as Intended?

Andrei Margeloiu, Matthew Ashman|arXiv (Cornell University)|May 10, 2021
Explainable Artificial Intelligence (XAI)参考文献 8被引用 18
一句话总结

本文研究了概念瓶颈模型(CBMs)是否按预期方式学习,发现联合训练和顺序训练无法在输入空间中生成语义上有意义的概念。通过事后可解释性方法(如积分梯度),作者表明这些概念并不对应于输入中的相关区域,从而削弱了可解释性、可预测性和可干预性——这表明目前CBMs唯一可行的方法可能是独立训练。

ABSTRACT

Concept bottleneck models map from raw inputs to concepts, and then from concepts to targets. Such models aim to incorporate pre-specified, high-level concepts into the learning procedure, and have been motivated to meet three desiderata: interpretability, predictability, and intervenability. However, we find that concept bottleneck models struggle to meet these goals. Using post hoc interpretability methods, we demonstrate that concepts do not correspond to anything semantically meaningful in input space, thus calling into question the usefulness of concept bottleneck models in their current form.

研究动机与目标

  • 评估概念瓶颈模型(CBMs)是否满足可解释性、可预测性和可干预性这三项核心期望。
  • 探究CBMs中预设的概念是否对应于输入空间中语义上有意义的特征。
  • 评估不同训练策略(联合、顺序和独立)在实现CBMs预期目标方面的有效性。
  • 考察现有事后可解释性方法在分析CBMs中概念表征时的局限性。
  • 挑战联合训练CBMs能产生概念上有意义且有用的表征这一假设。

提出的方法

  • 作者使用事后可解释性技术,包括积分梯度、梯度和SmoothGrad,分析每个概念在输入空间中的特征重要性。
  • 他们评估了三种训练策略:独立训练(使用真实概念分别训练g和f)、顺序训练(使用预测的概念训练f)和联合训练(使用加权损失联合训练g和f)。
  • 从概念层向输入空间生成显著性图,以可视化对每个概念最具影响力的输入区域。
  • 通过预测值与真实值之间(R²)的相关性,以及不同模型的目标预测之间的相关性,比较CBMs的性能。
  • 在两个基准数据集上进行实验:OAI(用于X光片分级,包含10个临床概念)和CUB(用于鸟类识别,包含112个语义属性)。
  • 研究比较了不同概念表征方式(如独热编码)下的模型行为,并通过将预测概念替换为真实值来评估可干预性。

实验结果

研究问题

  • RQ1采用联合或顺序目标训练的概念瓶颈模型是否会产生对应于输入空间中语义上有意义特征的概念?
  • RQ2CBMs在多大程度上满足可解释性、可预测性和可干预性这三项期望?
  • RQ3事后可解释性方法(如积分梯度)在将重要性归因于CBM概念的输入特征方面表现如何?
  • RQ4独立训练策略是否是当前CBM框架中唯一能实现全部三项期望的方法?
  • RQ5概念表征方式(如独热编码与标量)如何影响CBMs中可干预性和概念学习的成功?

主要发现

  • 联合训练和顺序训练的CBM变体未能学习到与有意义输入区域相对应的概念,显著性图显示其关注整个物体而非特定部分(如翅膀或腿部)。
  • 对于“翅膀图案”这一概念,联合与独立模型均将重要性分配给整只鸟,而非仅限于翅膀,表明概念的空间定位能力差。
  • 在鸟类图像中,“腿部颜色”概念在多种显著性方法下均未表现出对腿部的关注,证实了概念未映射到其预期的视觉区域。
  • 联合模型和顺序模型中预测值与真实值之间的相关性显著较低(R²分别为0.24和0.07),而概念真值模型的R²为0.47,表明概念预测性能差。
  • 独立CBM与概念真值模型的相关性最高(R² = 0.47),表明其最能保持概念完整性,可能是当前CBM框架中唯一可行的训练策略。
  • 本研究结论认为,现有显著性方法可能不足以解释CBMs中的概念表征,凸显了对更优归因技术的迫切需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。