Skip to main content
QUICK REVIEW

[论文解读] Towards Global Explanations for Credit Risk Scoring

Irene Unceta, Jordi Nin|arXiv (Cornell University)|Nov 19, 2018
Explainable Artificial Intelligence (XAI)参考文献 7被引用 10
一句话总结

本文提出了一种模型无关的复制框架,通过采样其决策函数来训练更简单、更透明的模型,从而为黑箱信用风险模型生成可解释的全局解释。该方法在保持可解释性和可分解性的同时,实现了高达79%的准确率,支持监管合规并改善特征重要性分析,无需预处理且不损失性能。

ABSTRACT

In this paper we propose a method to obtain global explanations for trained black-box classifiers by sampling their decision function to learn alternative interpretable models. The envisaged approach provides a unified solution to approximate non-linear decision boundaries with simpler classifiers while retaining the original classification accuracy. We use a private residential mortgage default dataset as a use case to illustrate the feasibility of this approach to ensure the decomposability of attributes during pre-processing.

研究动机与目标

  • 解决信用风险评分模型中高预测准确率与可解释性之间的矛盾。
  • 克服预处理步骤导致模型可分解性受损和监管合规性降低的局限性。
  • 开发一种方法,为黑箱分类器生成全局可解释的解释,而无需依赖局部或事后解释。
  • 通过用更简单但准确的可解释副本替代复杂模型,实现监管合规的高性能信用评分。
  • 通过直接从原始属性学习,避免使用不可分解的工程特征,从而保持特征重要性的清晰性。

提出的方法

  • 从原始特征空间中采样合成数据点,生成由原始模型预测结果标注的合成数据集。
  • 在合成数据集上训练副本模型(例如决策树或逻辑回归),以模仿原始模型的决策函数。
  • 通过无约束的经验风险最小化优化副本模型,避免正则化和超参数调优,以保留模型容量。
  • 将副本模型用作代理模型,直接在原始输入特征上复制原始模型的行为,确保全局可解释性。
  • 通过利用无限的合成数据流,使副本模型泛化能力得到保障,渐近减少泛化差距。
  • 优先考虑模型容量而非正则化,以避免复制过程中性能下降,与标准学习实践形成对比。

实验结果

研究问题

  • RQ1能否构建一个全局可解释的代理模型,以解释高性能黑箱信用风险模型的决策边界?
  • RQ2如何在复制过程中保持模型准确率,同时确保可解释性和监管合规性?
  • RQ3复制与标准机器学习在优化和泛化方面存在哪些根本性差异?
  • RQ4复制框架能否消除信用风险建模中对不可分解预处理的依赖?
  • RQ5副本模型在准确率和特征重要性一致性方面与原始黑箱模型相比表现如何?

主要发现

  • 当复制一个原始准确率为79%的梯度提升树模型时,该复制框架在原始测试数据上的平均准确率达到0.739 ± 0.018。
  • 副本模型在特征重要性排序上与原始模型保持高度一致,其分布更偏斜,表明对特征的区分能力更强。
  • 在可分解性场景下,副本模型在原始测试数据上的准确率为71%(±4%),替代了原始准确率为77%的预处理逻辑回归流程。
  • 副本模型成功将非线性、不可解释的梯度提升树替换为直接作用于原始特征的决策树,同时保持性能和可解释性。
  • 该方法消除了对不可分解特征工程的依赖,实现了基于原始数据属性的解释。
  • 研究识别出复制过程中的两个主要误差来源:有限的合成数据和高维特征空间中探索不足,建议未来工作集中于最优合成数据生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。