[论文解读] Individual Explanations in Machine Learning Models: A Survey for Practitioners
本综述提供了对机器学习模型中个体预测解释的最先进方法的全面分类与回顾,重点关注局部可解释性。它比较了LIME和SHAP等模型无关技术与神经网络及树模型的模型特定方法,突出显示了它们的优势、局限性以及在高风险领域实际应用的适用性。
In recent years, the use of sophisticated statistical models that influence decisions in domains of high societal relevance is on the rise. Although these models can often bring substantial improvements in the accuracy and efficiency of organizations, many governments, institutions, and companies are reluctant to their adoption as their output is often difficult to explain in human-interpretable ways. Hence, these models are often regarded as black-boxes, in the sense that their internal mechanisms can be opaque to human audit. In real-world applications, particularly in domains where decisions can have a sensitive impact--e.g., criminal justice, estimating credit scores, insurance risk, health risks, etc.--model interpretability is desired. Recently, the academic literature has proposed a substantial amount of methods for providing interpretable explanations to machine learning models. This survey reviews the most relevant and novel methods that form the state-of-the-art for addressing the particular problem of explaining individual instances in machine learning. It seeks to provide a succinct review that can guide data science and machine learning practitioners in the search for appropriate methods to their problem domain.
研究动机与目标
- 为刑事司法、医疗保健和金融等高风险领域日益增长的可解释机器学习需求提供支持。
- 为从业者提供一个针对个体预测的结构化局部解释方法分类体系。
- 识别当前方法的不足之处,特别是针对随机森林和梯度提升等复杂树模型的不足。
- 指导数据科学家根据模型类型、可解释性需求和计算约束选择合适的解释技术。
- 突出新兴趋势,例如向树模型可解释性转变的动向,这些模型在实际应用中正变得日益主导。
提出的方法
- 从三个维度对解释方法进行分类:范围(局部 vs. 全局)、通用性(模型无关 vs. 模型特定)以及解释类型(如特征归因、反事实)。
- 回顾基于扰动的模型无关方法(如LIME、SHAP),通过输入扰动近似局部模型行为。
- 研究对比性方法,如反事实和原型,通过与相似但不同的实例比较来解释预测结果。
- 分析卷积神经网络的模型特定技术(如Grad-CAM、Integrated Gradients、I-GOS),利用内部梯度和激活图。
- 讨论针对通用神经网络和决策树的定制化方法,包括使用SHAP值计算树集成模型忠实且无偏特征归因的TreeExplainer。
- 评估视觉解释(如热力图)的保真度和人类可读性,并识别其局限性,如模糊或误导性的显著性图。
实验结果
研究问题
- RQ1机器学习中局部解释方法的关键分类体系和分类标准是什么?
- RQ2LIME和SHAP等模型无关方法在个体预测的保真度、计算成本和可解释性方面如何比较?
- RQ3基于可视化的方法(如Grad-CAM和Integrated Gradients)在保真度和人类理解方面存在哪些局限性?
- RQ4尽管树模型在实践中表现出高性能和可解释性,为何当前的解释方法对这些模型效果较差?
- RQ5在模型可解释性方面,哪些新兴趋势可能塑造未来研究,特别是针对树模型?
主要发现
- 模型无关方法(如LIME和SHAP)应用广泛,但在高维特征空间中可能因采样变异性和偏差而受到影响。
- 与标准梯度相比,Integrated Gradients能生成更忠实且更不模糊的显著性图,但其热力图对人类理解仍具挑战。
- I-GOS通过使用Integrated Gradients作为下降方向,改进了显著性图中的掩码优化,减少了局部极小值问题,提升了解释保真度。
- Grad-CAM提供局部化、类别特定的注意力图,有助于诊断模型预测,尤其在输出看似反直觉时。
- TreeExplainer通过利用SHAP值,实现了对树模型的准确、无偏且高效的特征归因,克服了决策路径分析和模型无关方法的局限性。
- 尽管深度神经网络在研究中占主导地位,但树模型(如随机森林、梯度提升)因鲁棒性和可解释性而在实际应用中日益普及,这凸显了对这些模型更优个体解释方法的需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。