Skip to main content
QUICK REVIEW

[论文解读] A comparison of Deep Learning performances with other machine learning algorithms on credit scoring unbalanced data

Louis Marceau, Lingling Qiu|arXiv (Cornell University)|Jul 25, 2019
Financial Distress and Bankruptcy Prediction被引用 8
一句话总结

本研究在样本有限且高度不平衡的信用评分数据集上,对比了传统机器学习(如XGBoost、随机森林)与深度学习(DNN、Auto-Keras NAS)方法。尽管经过大量超参数调优和AutoML优化,XGBoost在F-score(0.5496 vs. 0.5399)上仍优于深度学习模型,且Auto-Keras未超越人工调优的DNN或树基模型,表明在小规模、不平衡的金融数据集中,NAS带来的收益有限。

ABSTRACT

Training models on highly unbalanced data is admitted to be a challenging task for machine learning algorithms. Current studies on deep learning mainly focus on data sets with balanced class labels or unbalanced data, but with massive amount of samples available, like in speech recognition. However, the capacities of deep learning on imbalanced data with little samples is not deeply investigated in literature, while it is a very common application context in numerous industries. To contribute to fill this gap, this paper compares the performances of several popular machine learning algorithms previously applied with success to unbalanced data set with deep learning algorithms. We conduct those experiments on a highly unbalanced data set, used for credit scoring. We evaluate various configuration including neural network optimization techniques and try to determine their capacities when they operate with imbalanced corpora.

研究动机与目标

  • 评估深度学习模型在样本有限、高度不平衡的信用评分数据上相对于传统机器学习算法的性能。
  • 探究在该背景下,如神经架构搜索(NAS)等AutoML技术是否能超越人工调优的深度神经网络及树基模型。
  • 评估在信用风险建模中,AutoML相较于传统机器学习与深度学习方法的计算成本与能效表现。
  • 确定在不平衡金融数据集中,特征工程与模型架构设计在实现高性能分类时是否依然关键。
  • 探索结合树基与深度学习分类器的混合模型在不平衡信用数据上提升性能的潜力。

提出的方法

  • 在包含12个月违约预测任务的真实信用卡数据集上,训练并比较了多种机器学习模型,包括XGBoost、随机森林和梯度提升模型。
  • 使用Keras实现标准超参数调优的深度神经网络(DNN),并应用批量归一化和ReLU激活等技术。
  • 在4小时搜索窗口内,应用Auto-Keras结合神经架构搜索(NAS)自动发现最优DNN架构与超参数。
  • 使用标准评估指标(包括精确率、召回率、F-score、AUC与运行时间)比较所有配置下的模型性能。
  • 从24个月的信用卡交易历史中提取并工程化特征,以表征用户行为作为模型输入。
  • 开展消融研究以隔离AutoML对模型性能的影响,将NAS优化的模型与人工调优的DNN及树基模型进行对比。

实验结果

研究问题

  • RQ1在样本有限、高度不平衡的信用评分数据上,深度学习模型是否能超越XGBoost和随机森林等传统机器学习算法?
  • RQ2与人工调优的DNN相比,使用神经架构搜索(NAS)的AutoML是否能提升不平衡金融数据集上的深度学习性能?
  • RQ3在信用风险建模中,AutoML技术相较于传统机器学习与深度学习模型的计算成本与能效表现如何?
  • RQ4在不平衡信用评分任务中,特征工程与模型架构设计在多大程度上仍对性能具有决定性影响?
  • RQ5结合树基与深度学习分类器的混合模型是否能提升不平衡信用数据上的分类性能?

主要发现

  • XGBoost在12个月违约预测任务中取得最高F-score(0.5496),优于人工调优的DNN(F-score:0.5399)与Auto-Keras NAS模型(F-score:0.5390)。
  • 与人工调优的DNN相比,Auto-Keras NAS配置提升了精确率(0.5146),但降低了召回率(0.5659),导致F-score更低,尽管训练时间更长。
  • DNN与Auto-Keras模型的计算成本显著高于XGBoost,运行时间分别为450.1秒与611秒,而XGBoost仅需299.8秒。
  • AutoML未发现超越XGBoost或人工调优DNN的神经架构,否定了NAS可无需专家经验即实现最先进性能的假设。
  • 本研究凸显了NAS的高能耗与高计算成本,提示在信用风险建模等实际应用中需进行成本-收益分析。
  • 尽管AutoML技术不断进步,但在小规模、不平衡的金融数据集中,特征工程与模型特定调优仍是实现最优性能的关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。