[论文解读] A Vertical Federated Learning Method for Interpretable Scorecard and Its Application in Credit Scoring
该论文提出FL-LRBC,一种用于训练具有系数有界约束的可解释逻辑回归评分卡的纵向联邦学习方法,实现金融机构间隐私保护下的协作。通过单次训练会话中的投影梯度优化方法,相比非联邦学习模型,AUC提升9%,KS统计量提升60%,且无需迭代超参数调优或数据共享。
With the success of big data and artificial intelligence in many fields, the applications of big data driven models are expected in financial risk management especially credit scoring and rating. Under the premise of data privacy protection, we propose a projected gradient-based method in the vertical federated learning framework for the traditional scorecard, which is based on logistic regression with bounded constraints, namely FL-LRBC. The latter enables multiple agencies to jointly train an optimized scorecard model in a single training session. It leads to the formation of the model with positive coefficients, while the time-consuming parameter-tuning process can be avoided. Moreover, the performance in terms of both AUC and the Kolmogorov-Smirnov (KS) statistics is significantly improved due to data enrichment using FL-LRBC. At present, FL-LRBC has already been applied to credit business in a China nation-wide financial holdings group.
研究动机与目标
- 解决在金融风险管理中训练可解释、高性能评分卡的同时保护数据隐私的挑战。
- 消除传统评分卡建模中耗时的迭代特征选择与超参数调优过程。
- 使多个金融机构能够协作训练单一、优化的评分卡模型,而无需共享原始数据。
- 通过逻辑回归中系数有界且非负的约束,保持模型的可解释性与鲁棒性。
- 在来自全国性金融集团(包括一家银行和一家支付公司)的真实数据上评估所提方法的性能。
提出的方法
- 在纵向联邦学习框架内,提出一种基于投影梯度的有界约束逻辑回归优化方法(FL-LRBC)。
- 在FATE联邦学习平台中实现该方法,以支持跨数据提供方的安全、去中心化训练。
- 应用证据权重(WOE)变换,将原始变量转换为信息驱动的特征,以提升模型可解释性。
- 在优化过程中施加非负系数约束,以确保模型的可解释性与鲁棒性。
- 采用单次训练会话,避免迭代调优,显著降低与传统方法相比的计算成本。
- 采用纵向FL设置,不同机构贡献不同的特征集,且不直接交换数据。
实验结果
研究问题
- RQ1能否在不共享原始数据的前提下,利用联邦学习框架训练出可解释的评分卡?
- RQ2基于有界约束的投影梯度方法是否能在单次训练会话中实现高性能,避免迭代超参数调优?
- RQ3通过跨机构协作实现的数据增强是否能提升信用评分模型的AUC与KS统计量?
- RQ4FL-LRBC方法在提升预测性能的同时,能在多大程度上保持模型的可解释性?
- RQ5与基于孤立数据训练的传统评分卡模型相比,FL-LRBC的性能如何?
主要发现
- FL-LRBC方法在测试集上实现了平均72.6%的AUC,相比非联邦学习模型相对提升了9%。
- KS统计量提升了60%,达到0.41,表明对违约与非违约申请人的区分能力更强。
- 模型训练耗时约30小时,显著低于传统方法中通常需要的数百小时迭代调优与特征选择时间。
- 所有模型系数均为非负值,符合金融评分卡对可解释性与鲁棒性的要求。
- 整合银行与支付公司数据显著提升了模型的稳定性和性能,相比仅使用单一机构数据效果更优。
- 该方法展示了实际可行性与可扩展性,已在一家全国性金融控股集团中启动部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。