[论文解读] Visual correspondence-based explanations improve AI robustness and human-AI team accuracy
本文提出两种自解释图像分类器 EMD-Corr 和 CHM-Corr,通过在预测前利用查询图像与训练样本之间的视觉对应关系生成解释,从而提升人工智能的鲁棒性与人机协作的准确率。与 ResNet-50 和 kNN 相比,这些模型在分布外(OOD)数据集上的准确率提升了 +1 至 +4 个百分点,人机协作实验表明,其解释显著提升了人类的决策能力,使 ImageNet 和 CUB 数据集上的人机协作准确率超过任一单独代理的表现。
Explaining artificial intelligence (AI) predictions is increasingly important and even imperative in many high-stakes applications where humans are the ultimate decision-makers. In this work, we propose two novel architectures of self-interpretable image classifiers that first explain, and then predict (as opposed to post-hoc explanations) by harnessing the visual correspondences between a query image and exemplars. Our models consistently improve (by 1 to 4 points) on out-of-distribution (OOD) datasets while performing marginally worse (by 1 to 2 points) on in-distribution tests than ResNet-50 and a $k$-nearest neighbor classifier (kNN). Via a large-scale, human study on ImageNet and CUB, our correspondence-based explanations are found to be more useful to users than kNN explanations. Our explanations help users more accurately reject AI's wrong decisions than all other tested methods. Interestingly, for the first time, we show that it is possible to achieve complementary human-AI team accuracy (i.e., that is higher than either AI-alone or human-alone), in ImageNet and CUB image classification tasks.
研究动机与目标
- 开发在预测前能够解释决策的自解释图像分类器,以提升鲁棒性与人机协作能力。
- 通过将决策建立在与训练样本的视觉对应关系之上,解决后处理解释与显著性图的局限性。
- 评估基于对应关系的解释是否能提升人类决策准确率,并实现更优的人机协作表现。
- 证明在图像分类任务中,互补性人机协作准确率——高于任一代理单独表现——是可实现的。
- 验证视觉对应关系解释在真实世界高风险人工智能应用(如人脸与鸟类识别)中的实用性。
提出的方法
- 模型首先基于图像级特征相似性(ResNet-50 layer4 特征)对训练图像进行排序,以匹配查询图像。
- 随后利用局部图像块之间的视觉对应关系,对前 50 名候选样本进行重排序,测量查询图像与样本之间局部图像块的相似性。
- 最终预测通过取重排序后前 20 名候选样本中的多数类别得出,这些候选样本同时也作为解释。
- 该方法使用地球移动距离(EMD)和余弦相似度计算块级对应关系,强调结构对齐而非背景特征。
- 该方法应用于 ImageNet 和 CUB 数据集,在分布内及多个 OOD 基准(包括 ImageNet-R、ImageNet-Sketch、DAmageNet 和对抗性补丁)上进行评估。
- 在 ImageNet 和 CUB 上开展的大规模人类研究,比较了基于对应关系的解释与 kNN 解释的实用性,测量人类准确率与协作表现。
实验结果
研究问题
- RQ1与 ResNet-50 和 kNN 等标准模型相比,基于视觉对应关系的解释是否能提升 AI 分类器在分布外(OOD)数据上的鲁棒性?
- RQ2基于对应关系的解释是否能提升人机协作图像分类任务中人类的决策准确率?
- RQ3当使用基于对应关系的解释时,人机协作团队能否实现互补性准确率——即高于任一代理单独表现的准确率?
- RQ4解释的质量如何影响 AI 辅助人类决策的可靠性,特别是在对抗性或模糊输入的情况下?
- RQ5是否存在一个实际的 AI 置信度阈值,使得在结合 AI 预测与人类判断时,能实现最优的人机协作表现?
主要发现
- EMD-Corr 和 CHM-Corr 在 OOD 数据上的准确率相比 ResNet-50 和 kNN 提升了 1 至 4 个百分点,而在分布内 ImageNet 上表现略低(低 1–2 个百分点)。
- 在大规模人类研究中,基于对应关系的解释使人类在识别错误 AI 预测方面的准确率显著高于 kNN 解释。
- 在 ImageNet 上,基于对应关系的解释实现了超越 AI 单独预测与人类单独判断的人机协作准确率,证明了互补性能。
- 在 CUB 上,人机协作准确率同样高于任一代理单独表现,尽管提升幅度较小(+0.02),表明该方法在细粒度分类任务中也具有实用性。
- 当 AI 作出高置信度预测(置信度 ≥ T)而人类处理其余情况时,实现了最优的人机协作表现,团队准确率在最优阈值 T* 处达到最大。
- 研究证实,在高风险人工智能应用中,视觉对应关系解释比显著性图和 kNN 解释更有效地支持人类决策。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。