[论文解读] DeRisk: An Effective Deep Learning Framework for Credit Risk Prediction over Real-World Financial Data
DeRisk 是一种新颖的深度学习框架,用于信用风险预测,在真实世界金融数据上通过使用三阶段流程(数据预处理与特征选择及数据增强、非序列与序列模型分别训练、联合微调)超越了传统统计模型。它通过加权二元交叉熵损失、过采样和掩码语言建模预训练等技术实现最先进性能,表明在工业金融应用中,精心设计与优化对深度学习成功至关重要。
Despite the tremendous advances achieved over the past years by deep learning techniques, the latest risk prediction models for industrial applications still rely on highly handtuned stage-wised statistical learning tools, such as gradient boosting and random forest methods. Different from images or languages, real-world financial data are high-dimensional, sparse, noisy and extremely imbalanced, which makes deep neural network models particularly challenging to train and fragile in practice. In this work, we propose DeRisk, an effective deep learning risk prediction framework for credit risk prediction on real-world financial data. DeRisk is the first deep risk prediction model that outperforms statistical learning approaches deployed in our company's production system. We also perform extensive ablation studies on our method to present the most critical factors for the empirical success of DeRisk.
研究动机与目标
- 解决在高维、稀疏、噪声大且类别不平衡的真实世界金融数据上训练鲁棒深度神经网络的挑战。
- 开发一种深度学习框架,使其在工业规模金融数据上的信用风险预测性能超越现有统计模型(如 XGBoost、随机森林)。
- 通过广泛的消融研究,识别并验证对深度学习在此领域实证成功有贡献的关键技术组件。
- 为在数据质量低且类别极度不平衡的真实金融应用中部署深度学习,提供实用且可操作的见解。
提出的方法
- 该框架采用三阶段流程:包含特征选择和深度学习专用数据增强的数据预处理、非序列与序列模型的独立训练,以及在多格式数据上的联合微调。
- 使用 XGBoost 选择实值特征以降低维度,同时保留预测能力,最优性能在 500 个特征时达到。
- 显式包含缺失值(NaN)和零值的指示特征,以保留有意义的模式,而非用常数填充。
- 使用加权二元交叉熵(BCE)损失以应对数据不平衡问题,为罕见正样本(违约)分配更高权重。
- 选择性应用过采样:其在序列 Transformer 模型中可提升优化与性能,但在非序列 DNN 中导致过拟合,因此需采用模型特定的采样策略。
- 对序列模型应用掩码语言建模(MLM)预训练,通过利用序列数据结构提升优化与性能。
实验结果
研究问题
- RQ1深度学习框架能否在低质量金融数据上超越 XGBoost 和随机森林等成熟统计模型,在真实世界信用风险预测中表现更优?
- RQ2在类别不平衡、高维稀疏金融数据上,训练流程中的哪些具体组件对实现深度学习优越性能最为关键?
- RQ3特征选择、指示特征、损失加权、过采样和预训练等技术如何影响模型性能与优化稳定性?
- RQ4为何端到端深度学习在真实世界金融数据上会失败?何种替代训练策略更为有效?
主要发现
- DeRisk 在公司真实部署中超越了生产级基于决策树的系统,AUC 分数高于现有统计模型。
- 使用 XGBoost 进行特征选择显著提升性能,最优结果在选择 500 个实值特征时达成;减少至 100 个特征或取消选择均导致性能下降。
- 包含 NaN 和零值指示特征相比简单填充或删除,AUC 提升 0.0073,表明缺失模式本身具有预测价值。
- 加权 BCE 损失在测试的损失函数中表现最佳,优于标准 BCE 和焦点损失(Focal loss),凸显在类别不平衡场景下类别加权的重要性。
- 过采样可加速序列 Transformer 模型的优化并提升性能,但在非序列 DNN 中导致过拟合,表明需采用模型特定的采样策略。
- 对序列模型进行 MLM 预训练可同时提升性能与优化速度,证明在序列信用历史数据上进行预训练具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。