Skip to main content
QUICK REVIEW

[论文解读] PSD2 Explainable AI Model for Credit Scoring

Neus Llop Torrent, Giorgio Visani|arXiv (Cornell University)|Nov 20, 2020
Financial Distress and Bankruptcy Prediction参考文献 33被引用 6
一句话总结

本文提出了一种基于CatBoost的可解释人工智能信用评分模型,通过利用SHAP值实现全局和局部可解释性,实现了0.68的GINI得分。该模型在提升预测准确性方面优于传统的逻辑回归,同时通过透明的、基于特征的贷款审批决策解释,确保了监管合规性。

ABSTRACT

The aim of this project is to develop and test advanced analytical methods to improve the prediction accuracy of Credit Risk Models, preserving at the same time the model interpretability. In particular, the project focuses on applying an explainable machine learning model to bank-related databases. The input data were obtained from open data. Over the total proven models, CatBoost has shown the highest performance. The algorithm implementation produces a GINI of 0.68 after tuning the hyper-parameters. SHAP package is used to provide a global and local interpretation of the model predictions to formulate a human-comprehensive approach to understanding the decision-maker algorithm. The 20 most important features are selected using the Shapley values to present a full human-understandable model that reveals how the attributes of an individual are related to its model prediction.

研究动机与目标

  • 开发一种高精度、可解释的信用评分模型,符合GDPR和PSD2法规要求。
  • 克服传统逻辑回归在捕捉非线性特征关系方面的局限性。
  • 应用可解释人工智能(XAI)技术,为模型预测提供透明、人类可理解的解释。
  • 评估机器学习模型(尤其是CatBoost)在不平衡金融数据集上的性能。
  • 利用Shapley值识别影响信用风险决策的关键行为特征。

提出的方法

  • 本研究使用金融机构提供的开放银行数据来训练信用评分模型。
  • 经过超参数调优后,选择CatBoost作为主要模型,因其在不平衡数据集上表现更优。
  • 应用SHAP(SHapley Additive exPlanations)计算模型预测的全局和局部可解释性。
  • 从Shapley值中推导出特征重要性,识别出对预测结果影响最大的20个特征。
  • 评估了重采样技术以解决数据集类别不平衡问题,从而影响模型的公平性和性能。
  • 使用瀑布图和依赖图可视化SHAP值,揭示了非直观的模型行为,例如极端收入值与更高违约风险相关。

实验结果

研究问题

  • RQ1在不平衡金融数据上,CatBoost与逻辑回归、决策树和神经网络在信用评分准确性方面有何比较?
  • RQ2在受监管的金融环境中,SHAP值在多大程度上能提供模型预测的全局和局部可解释性?
  • RQ3哪些基于交易的特征对模型预测信用资质的影响最为显著?
  • RQ4为何交易金额的极端值(例如高收入交易)与更高的违约风险相关,这与直观预期相反?
  • RQ5重采样技术在数据不平衡条件下对信用评分模型的性能和公平性有何影响?

主要发现

  • 经过超参数调优后,CatBoost在性能上表现最佳,GINI得分为0.68,优于逻辑回归、决策树和神经网络。
  • SHAP分析显示,交易历史中极端收入值(例如超过75€)与更高的违约风险相关,这与初始假设相反。
  • 该模型发现,若一个月内最大收入交易金额较高,且上个月也存在类似金额的交易,则显著增加误判为“坏客户”的可能性(即假阴性)。
  • 诸如trx_max_all_last30和trx_max_incoming_last30等特征在预测违约风险方面具有显著影响力,SHAP值显示其存在非线性效应。
  • 在缺乏显著更大数据集的情况下,神经网络表现欠佳,表明其在数据有限的信用评分场景中并非最优选择。
  • 本研究证明,像SHAP这样的可解释人工智能技术能够揭示金融数据中非直观但统计上有效的模式,从而增强模型的透明度和可信度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。