Skip to main content
QUICK REVIEW

[論文レビュー] Application of Deep Neural Networks to assess corporate Credit Rating

Parisa Golbayani, Dan Wang|arXiv (Cornell University)|Mar 4, 2020
Financial Distress and Bankruptcy Prediction参考文献 41被引用数 18
ひとこと要約

本研究では、エネルギー、金融、医療セクターの米国財務データを用いて、S&P企業格付けを予測するための4つの深層ニューラルネットワークアーキテクチャ—MLP、CNN、CNN2D、LSTM—を評価する。LSTMは、時系列データの分割手法を用いる場合に他のアーキテクチャを常に上回り、手動による特徴量選択よりも全特徴量セットを用いることでより優れた結果が得られることを明らかにした。

ABSTRACT

Recent literature implements machine learning techniques to assess corporate credit rating based on financial statement reports. In this work, we analyze the performance of four neural network architectures (MLP, CNN, CNN2D, LSTM) in predicting corporate credit rating as issued by Standard and Poor's. We analyze companies from the energy, financial and healthcare sectors in US. The goal of the analysis is to improve application of machine learning algorithms to credit assessment. To this end, we focus on three questions. First, we investigate if the algorithms perform better when using a selected subset of features, or if it is better to allow the algorithms to select features themselves. Second, is the temporal aspect inherent in financial data important for the results obtained by a machine learning algorithm? Third, is there a particular neural network architecture that consistently outperforms others with respect to input features, sectors and holdout set? We create several case studies to answer these questions and analyze the results using ANOVA and multiple comparison testing procedure.

研究の動機と目的

  • 財務諸表データを用いて、深層ニューラルネットワークのS&P企業格付け予測性能を評価すること。
  • ニューラルネットワークが手動で選択された特徴量よりも、自動的特徴量選択を許可された場合に優れた性能を示すかどうかを調査すること。
  • 財務データに内在する時系列構造がモデル性能に与える影響を評価すること。
  • 特定のニューラルネットワークアーキテクチャが、セクターおよびデータ分割手法にかかわらず一貫して他のアーキテクチャを上回るかどうかを同定すること。
  • ANOVAおよび多重比較検定を用いた統計的に厳密な比較を通じて、モデル性能の差を検証すること。

提案手法

  • 四半期ごとの財務諸表データを用いて、マルチレイヤーパーセプトロン(MLP)、畳み込みニューラルネットワーク(CNN)、2次元畳み込みネットワーク(CNN2D)、長期短期記憶(LSTM)の4つの深層ニューラルネットワークアーキテクチャを訓練した。
  • 時系列ホールドアウト戦略を採用—テスト用に1年分のデータを完全に除外—、実際の格付け実務における将来の格付けが過去の財務報告に依存するのを模倣した。
  • 時系列漏れが性能指標に与える影響を評価するため、ランダムなトレイン・テスト分割との比較を実施した。
  • 二元配置分散分析(two-way ANOVA)およびテューキーのHSD後続検定を用いて、ネットワークアーキテクチャおよびセクターごとのモデル性能差の統計的有意性を評価した。
  • 入力特徴量およびデータ分割戦略を変化させた複数のケーススタディを実施し、アーキテクチャ、特徴量選択、時系列構造の影響を分離した。
  • 主な性能指標としてテストセットにおける正答率(percent accuracy)を用い、各セクターおよびモデルアーキテクチャごとに分析を行った。

実験結果

リサーチクエスチョン

  • RQ1すべての財務諸表変数を入力として使用することで、手動で選択された特徴量サブセットを使用する場合よりも、ニューラルネットワークが自動的特徴量選択を効果的に行えるか?
  • RQ2財務データに内在する時系列構造がモデル性能に重要であるか?また、時系列ホールドアウトとランダム分割の性能評価を比較するとどうなるか?
  • RQ3特定のニューラルネットワークアーキテクチャが、異なるセクターおよびデータ分割戦略において一貫して他のアーキテクチャを上回るか?
  • RQ4ANOVAや多重比較検定を用いた厳密な統計的検証を通じて、MLP、CNN、CNN2D、LSTMの各アーキテクチャの性能をどのように比較できるか?
  • RQ5時系列データの分割手法が、信用格付け予測における機械学習モデルの性能評価にどの程度影響を及ぼすか?

主な発見

  • 財務諸表のすべての変数を入力として使用した場合、手動で選択されたサブセットを使用した場合よりも顕著に高いモデル性能が得られた。これは、深層ニューラルネットワークが自動的特徴量選択を効果的に行えることを示している。
  • 時系列ホールドアウト(1年分のホールドアウト)は、ランダムなトレイン・テスト分割に比べて、より現実的で保守的な性能推定をもたらした。これは、四半期ごとのデータ漏れが発生するため、ランダム分割はモデル性能を誇張していたことを示している。
  • ランダムなトレイン・テスト分割は、時系列分割よりも顕著に高い正答率を示した。これは、評価時に時系列依存性を無視した場合、過学習のリスクが高まることを示している。
  • LSTMは、すべてのセクターおよびケーススタディにおいて一貫して最高の性能を示し、複数の比較で統計的に優れた性能を示した。
  • 二元配置分散分析により、ネットワークアーキテクチャおよびセクターの両方がモデル性能に顕著な影響を与えることが確認された(p < 0.001)。また、両者の交互作用効果も顕著であった(p = 7.59e-45)。
  • 特定のアーキテクチャがすべてのセクターで優勢だったわけではなかったが、LSTMは常に上位パフォーマンスグループに位置づけられ、実務における信用格付け予測の最も頑健な選択肢であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。