[论文解读] Developing a Fidelity Evaluation Approach for Interpretable Machine Learning
本文提出了一种三阶段保真度评估方法,用于评估局部特征归因方法(LIME 和 SHAP)在表格型黑箱模型中的解释准确性。通过使用透明的白箱模型作为代理,该方法通过测量黑箱模型与解释在支持性及相反性特征扰动下的一致性来评估解释保真度,结果表明保真度在很大程度上取决于模型复杂度、数据结构以及黑箱模型和可解释方法的内部机制,且没有一种方法在所有情况下始终优于另一种。
Although modern machine learning and deep learning methods allow for complex and in-depth data analytics, the predictive models generated by these methods are often highly complex, and lack transparency. Explainable AI (XAI) methods are used to improve the interpretability of these complex models, and in doing so improve transparency. However, the inherent fitness of these explainable methods can be hard to evaluate. In particular, methods to evaluate the fidelity of the explanation to the underlying black box require further development, especially for tabular data. In this paper, we (a) propose a three phase approach to developing an evaluation method; (b) adapt an existing evaluation method primarily for image and text data to evaluate models trained on tabular data; and (c) evaluate two popular explainable methods using this evaluation method. Our evaluations suggest that the internal mechanism of the underlying predictive model, the internal mechanism of the explainable method used and model and data complexity all affect explanation fidelity. Given that explanation fidelity is so sensitive to context and tools and data used, we could not clearly identify any specific explainable method as being superior to another.
研究动机与目标
- 为解决表格型数据中解释保真度缺乏稳健、功能基础的评估方法的问题。
- 开发一种可适应于训练于表格型数据集的黑箱模型的保真度评估框架。
- 在多样化表格型数据集中评估两种广泛使用的局部特征归因方法——LIME 和 SHAP 的保真度。
- 研究黑箱模型和可解释模型的内部机制、模型复杂度及数据特征如何影响解释保真度。
- 为现实世界表格型机器学习应用中的解释质量评估提供可复现、透明的方法。
提出的方法
- 阶段1:在与黑箱模型相同的训练数据上,训练一个完全透明、本质可解释的白箱模型(如决策树或线性模型),用作解释评估的基准。
- 阶段2:利用白箱模型对黑箱模型生成的解释进行细化与校准,通过测试支持性解释和相反性解释的特征扰动来实现。
- 阶段3:应用经优化的评估方法,以白箱模型为参考,评估黑箱模型解释的保真度,测量解释与真实决策边界的一致性。
- 定义两种保真度度量:'支持性保真度'(黑箱模型与解释在保持预测的扰动下的一致性)和'相反性保真度'(黑箱模型与解释在改变预测的扰动下的一致性)。
- 基于启发式方法选择特征及特征值进行扰动,依据模型重要性与数据分布进行引导。
- 将该方法应用于来自 UCI 机器学习存储库的六个开源表格型数据集,对 LIME 和 SHAP 在回归与分类任务中进行评估。
实验结果
研究问题
- RQ1如何系统性地为表格型数据开发一种功能基础的解释保真度评估方法?
- RQ2黑箱模型和可解释方法的内部机制在多大程度上影响解释保真度?
- RQ3模型与数据的复杂度如何影响 LIME 和 SHAP 生成的解释保真度?
- RQ4白箱代理模型能否在表格型情境中可靠地支持黑箱模型解释的评估?
- RQ5在多样化表格型数据集中,是否存在一种可解释方法(LIME 或 SHAP)在保真度上始终优于另一种?
主要发现
- 解释保真度对底层黑箱模型的内部机制高度敏感,模型越复杂,解释的可靠性越低。
- 可解释方法的内部机制(如 LIME 的局部线性近似或 SHAP 的博弈论方法)显著影响保真度结果。
- 模型与数据的复杂度是解释保真度的关键决定因素,复杂度越高,解释质量的变异性越大。
- 在所有数据集和任务中,没有一种可解释方法(LIME 或 SHAP)始终优于另一种,表明性能具有上下文依赖性。
- 解释保真度的边界很少是确定的,表明解释往往脆弱且对特征值的微小扰动高度敏感。
- 所提出的三阶段方法成功实现了对表格型机器学习模型解释保真度的可复现、透明且上下文感知的评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。