[论文解读] On the overlooked issue of defining explanation objectives for local-surrogate explainers
本文揭示了局部代理可解释性方法中的一个关键缺陷:尽管这些方法都旨在解释单个模型预测,但其解释目标缺乏清晰定义,导致输出不一致且不可比较。作者分析了LIME、KernelSHAP和GSLS等方法在邻域构建策略上的差异,发现它们从黑箱模型中提取的信息各不相同,从而损害了可解释性工具的可比性和用户信任。
Local surrogate approaches for explaining machine learning model predictions have appealing properties, such as being model-agnostic and flexible in their modelling. Several methods exist that fit this description and share this goal. However, despite their shared overall procedure, they set out different objectives, extract different information from the black-box, and consequently produce diverse explanations, that are -- in general -- incomparable. In this work we review the similarities and differences amongst multiple methods, with a particular focus on what information they extract from the model, as this has large impact on the output: the explanation. We discuss the implications of the lack of agreement, and clarity, amongst the methods' objectives on the research and practice of explainability.
研究动机与目标
- 识别并分析局部代理解释器在解释目标方面缺乏清晰定义的问题。
- 研究局部代理方法中不同邻域构建策略如何从黑箱模型中提取不同的信息。
- 揭示这种模糊性对方法可比性以及可解释性技术实际部署的影响。
- 倡导在选择或设计可解释性方法之前,先以用户为中心明确解释目标。
- 呼吁在可解释性研究中采用正式且明确定义的目标,以提升方法的透明度和可靠性。
提出的方法
- 本文对局部代理解释器中的邻域构建进行了理论分析,重点关注每种方法如何采样并加权预测点周围的实例以实现解释。
- 对比了LIME、GSLS、LEAP和KernelSHAP在邻域构建策略上的差异,强调其在采样分布和加权方案上的不同。
- 采用统一的实验设置(Half-Moons数据集和神经网络黑箱模型)来可视化并对比各方法生成的邻域。
- 形式化了KernelSHAP中的信息提取过程,揭示其依赖于Shapley值近似和特征独立性等假设。
- 在Adult数据集上评估了LIME和KernelSHAP的解释结果,展示了对同一预测的特征重要性排序存在冲突。
- 批判了当前方法的启发式和近似性质,认为其输出与正式目标之间缺乏清晰的语义关联。
实验结果
研究问题
- RQ1不同的局部代理解释器如何定义其解释目标?这些目标在多大程度上是透明或一致的?
- RQ2各种局部代理方法从黑箱模型中提取了哪些具体信息?这如何影响最终的解释结果?
- RQ3为何像LIME和KernelSHAP这样的方法在输入和模型完全相同的情况下,会对同一预测产生冲突的解释?
- RQ4当前的局部代理方法在多大程度上依赖于近似和假设,从而损害其输出的可解释性?
- RQ5通过在方法开发前正式定义解释目标,可解释性AI领域可在哪些方面得到改进?
主要发现
- 即使使用相同的黑箱模型和预测目标,不同的局部代理方法在相同实例周围生成的邻域存在显著差异。
- LIME使用基于局部性的高斯邻域和加权方式,而GSLS则在最近反事实点周围进行均匀采样,导致生成的局部表示截然不同。
- KernelSHAP通过Shapley值近似提取信息,依赖于特征独立性和线性假设,这可能导致特征真实贡献的失真。
- 尽管LIME和KernelSHAP具有相同的高层次目标(即解释预测),但在Adult数据集的同一实例上,它们却得出了冲突的特征重要性排序。
- 由于缺乏正式且以用户为导向的解释目标,导致输出不可比较,阻碍了方法评估,并削弱了在实际应用中的可信度。
- 当前局部代理解释器的最先进水平存在“先解决问题,后定义问题”的倾向,严重损害了解释结果的可靠性和可比性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。