[论文解读] Do Users Benefit From Interpretable Vision? A User Study, Baseline, And Dataset
本文评估了用户在使用可解释视觉方法(特别是基于概念的解释和反事实解释)时是否能从中学到比仅通过模型logits对图像进行分组的简单基线方法中获益。在具有可控偏见的合成数据集(Two4Two)上进行的240名参与者用户研究发现,基线方法优于基于概念的解释,而基于可逆神经网络的反事实解释表现相似但能略微更准确地识别属性,凸显了对可解释性工具进行以用户为中心的评估的必要性。
A variety of methods exist to explain image classification models. However, whether they provide any benefit to users over simply comparing various inputs and the model's respective predictions remains unclear. We conducted a user study (N=240) to test how such a baseline explanation technique performs against concept-based and counterfactual explanations. To this end, we contribute a synthetic dataset generator capable of biasing individual attributes and quantifying their relevance to the model. In a study, we assess if participants can identify the relevant set of attributes compared to the ground-truth. Our results show that the baseline outperformed concept-based explanations. Counterfactual explanations from an invertible neural network performed similarly as the baseline. Still, they allowed users to identify some attributes more accurately. Our results highlight the importance of measuring how well users can reason about biases of a model, rather than solely relying on technical evaluations or proxy tasks. We open-source our study and dataset so it can serve as a blue-print for future studies. For code see, https://github.com/berleon/do_users_benefit_from_interpretable_vision
研究动机与目标
- 调查现代可解释视觉方法是否能提升用户检测模型偏见的能力,相比仅通过模型输出对输入进行分组的简单基线方法。
- 开发一个合成数据集(Two4Two),以实现对特征和偏见的可控操控,用于模型可解释性用户研究。
- 在已知数据生成过程的受控环境中量化真实特征重要性。
- 建立一个仅使用模型输出的基准基线,以供未来可解释性技术评估之用。
- 开源数据集、模型、研究设计和教程,以支持未来研究的可复现性和可适应性。
提出的方法
- 开发了Two4Two,一个合成数据集生成器,可创建包含两个抽象动物的图像,其属性(如颜色、形状)可控制,并与二元目标类别相关联。
- 设计了一种基线解释方法,将输入图像按模型输出的logits分组排列成网格,使用户能够直观比较输入和预测结果。
- 使用可逆神经网络(INNs)生成反事实解释,通过图像插值使模型预测发生翻转,同时最小化无关属性的变化。
- 采用一种先进的方法(Zhang et al., 2021)识别基于概念的解释,以在潜在空间中发现可解释的特征。
- 开展一项用户研究(N=240),参与者逐项查看一种解释类型,并被要求识别导致模型预测的相关属性。
- 收集二元选择结果和文本说明,以评估准确性和可用性,并通过质量检查确保众包响应的可靠性。
实验结果
研究问题
- RQ1仅通过模型输出对输入进行分组的简单基线方法,是否在帮助用户识别与偏见相关的属性方面优于基于概念的解释和反事实解释?
- RQ2通过可逆神经网络生成的反事实解释,是否能在检测模型偏见方面提升用户表现,超过基线方法?
- RQ3用户如何理解和推理基于概念的解释?在实际应用中出现了哪些可用性问题?
- RQ4当呈现不同解释技术时,用户在多大程度上能正确识别出真实偏见相关属性?
- RQ5当偏见较强或较弱时,解释方法的性能如何变化?用户对反事实中细微变化的感知如何?
主要发现
- 基线方法——即按模型logits对图像进行分组——在帮助用户识别与偏见相关的属性方面显著优于基于概念的解释。
- 基于可逆神经网络的反事实解释在整体准确度上与基线方法相当,但能更准确地识别最强偏见。
- 参与者在理解基于概念的解释时遇到困难,尤其因特征区域的空间重叠以及缺乏对相关特征的有效突出显示。
- 文本说明揭示了所有解释类型均存在可用性问题,包括对哪些属性被改变的混淆,以及对反事实中背景变化的误解。
- 尽管技术上更为复杂,但基于概念和反事实的解释均未显著优于简单基线,凸显了以用户为中心评估的必要性。
- 本研究表明,仅靠技术评估是不够的;必须直接测量真实用户的性能,才能准确评估可解释性方法的实际效益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。