Skip to main content
QUICK REVIEW

[论文解读] Application of Deep Neural Networks to assess corporate Credit Rating

Parisa Golbayani, Dan Wang|arXiv (Cornell University)|Mar 4, 2020
Financial Distress and Bankruptcy Prediction参考文献 41被引用 18
一句话总结

本研究评估了四种深度神经网络架构——MLP、CNN、CNN2D 和 LSTM——在使用美国能源、金融和医疗保健行业财务数据预测标普企业信用评级方面的表现。研究发现,LSTM 在使用时间序列数据划分时表现始终优于其他模型,且使用完整特征集的结果优于人工特征选择。

ABSTRACT

Recent literature implements machine learning techniques to assess corporate credit rating based on financial statement reports. In this work, we analyze the performance of four neural network architectures (MLP, CNN, CNN2D, LSTM) in predicting corporate credit rating as issued by Standard and Poor's. We analyze companies from the energy, financial and healthcare sectors in US. The goal of the analysis is to improve application of machine learning algorithms to credit assessment. To this end, we focus on three questions. First, we investigate if the algorithms perform better when using a selected subset of features, or if it is better to allow the algorithms to select features themselves. Second, is the temporal aspect inherent in financial data important for the results obtained by a machine learning algorithm? Third, is there a particular neural network architecture that consistently outperforms others with respect to input features, sectors and holdout set? We create several case studies to answer these questions and analyze the results using ANOVA and multiple comparison testing procedure.

研究动机与目标

  • 评估深度神经网络在使用财务报表数据预测标普企业信用评级方面的表现。
  • 调查神经网络在使用手动选择的特征或允许其执行自动特征选择时的表现差异。
  • 评估财务数据中固有时序结构对模型表现的重要性。
  • 确定是否存在某种神经网络架构在不同行业和数据划分方法下始终优于其他架构。
  • 通过方差分析(ANOVA)和多重比较检验,提供统计上严谨的模型表现差异验证。

提出的方法

  • 在季度财务报表数据上训练四种深度神经网络架构:多层感知机(MLP)、卷积神经网络(CNN)、二维卷积网络(CNN2D)和长短期记忆网络(LSTM)。
  • 采用时间序列保留策略——保留一年完整数据用于测试——以模拟现实世界信用评级实践,即未来评级依赖于先前的财务报告。
  • 与随机训练-测试划分进行对比,以评估时间序列泄漏对性能指标的影响。
  • 应用双因素方差分析(ANOVA)和 Tukey’s HSD 多重比较事后检验,评估不同网络架构和行业间模型表现差异的统计显著性。
  • 通过多种案例研究,采用不同输入特征和数据划分策略,以隔离架构、特征选择和时序结构的影响。
  • 以测试集上的准确率百分比作为主要性能指标,结果按行业和模型架构分别分析。

实验结果

研究问题

  • RQ1允许神经网络从所有财务报表变量中自动选择特征,是否优于使用手动选择的特征子集?
  • RQ2财务数据中固有时序结构对模型表现是否至关重要?时间序列保留与随机划分在性能评估中的表现有何差异?
  • RQ3是否存在一种神经网络架构在不同行业和数据划分策略下始终优于其他架构?
  • RQ4在经过严格的统计检验后,不同架构(MLP、CNN、CNN2D、LSTM)的表现如何比较?
  • RQ5时间序列数据划分在多大程度上影响了机器学习模型在信用评级预测中表现的评估?

主要发现

  • 使用所有财务报表变量作为输入,而非手动选择的子集,显著提升了模型表现,表明深度神经网络能有效执行自动特征选择。
  • 时间序列保留(一年保留)产生的性能估计更真实、更保守,而随机训练-测试划分因季度间数据泄漏导致模型表现被高估。
  • 随机训练-测试划分的准确率显著高于时间序列划分,凸显了在评估中未尊重时间依赖性时存在过拟合风险。
  • LSTM 在所有行业和案例研究中始终排名第一,且在多次比较中表现出统计学上的显著优势。
  • 双因素方差分析确认,网络架构和行业对模型表现均有极显著影响(p < 0.001),且存在显著的交互效应(p = 7.59e-45)。
  • 尽管没有单一架构在所有行业中均占绝对主导,但 LSTM 始终处于表现最佳组中,表明其在实践中是最具鲁棒性的信用评级预测选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。