Skip to main content
QUICK REVIEW

[論文レビュー] A Vertical Federated Learning Method for Interpretable Scorecard and Its Application in Credit Scoring

Fanglan Zheng, Erihe|arXiv (Cornell University)|Sep 14, 2020
Privacy-Preserving Technologies in Data参考文献 8被引用数 14
ひとこと要約

本論文では、係数の上限を設けることで解釈可能性を保ちつつ、金融機関間でのプライバシー保護型協働学習を可能にする垂直フェデレーテッドラーニング手法であるFL-LRBCを提案する。1回の学習セッションで投影勾配に基づく最適化を実行することにより、反復的なハイパーパrameterチューニングやデータ共有を不要とし、非フェデレーテッドモデルに比べAUCが+9%、KS統計量が+60%向上した。

ABSTRACT

With the success of big data and artificial intelligence in many fields, the applications of big data driven models are expected in financial risk management especially credit scoring and rating. Under the premise of data privacy protection, we propose a projected gradient-based method in the vertical federated learning framework for the traditional scorecard, which is based on logistic regression with bounded constraints, namely FL-LRBC. The latter enables multiple agencies to jointly train an optimized scorecard model in a single training session. It leads to the formation of the model with positive coefficients, while the time-consuming parameter-tuning process can be avoided. Moreover, the performance in terms of both AUC and the Kolmogorov-Smirnov (KS) statistics is significantly improved due to data enrichment using FL-LRBC. At present, FL-LRBC has already been applied to credit business in a China nation-wide financial holdings group.

研究の動機と目的

  • 金融リスク管理における解釈可能性と高い性能を持つスコアカードの訓練を、データプライバシーを保ちながら実現すること。
  • 従来のスコアカードモデリングにおける反復的特徴選択およびハイパーパrameterチューニングの煩雑なプロセスを排除すること。
  • 複数の金融機関が生データを共有せずに、1つの最適化されたスコアカードモデルを共同で訓練できること。
  • ロジスティック回帰における非負の係数制約を課すことにより、モデルの解釈可能性と頑健性を維持すること。
  • 全国規模の金融グループ(銀行および決済会社を含む)の実世界データを用いて、提案手法の性能を評価すること。

提案手法

  • 垂直フェデレーテッドラーニングフレームワーク内において、境界付き制約を課したロジスティック回帰のための投影勾配に基づく最適化手法(FL-LRBC)を提案する。
  • FATEフェデレーテッドラーニングプラットフォームに実装し、データ提供者間で安全かつ分散型の学習を可能にする。
  • モデルの解釈可能性を向上させるために、原始変数を情報駆動型特徴に変換する「重みのオーディエンス(WOE)変換」を適用する。
  • 最適化中に非負の係数制約を課すことにより、モデルの解釈可能性と頑健性を保証する。
  • 反復的チューニングを回避するため、1回の学習セッションでモデルを訓練し、従来手法と比較して計算コストを大幅に削減する。
  • 異なる機関が異なる特徴セットを提供する垂直FL設定を採用し、直接的なデータ交換は行わない。

実験結果

リサーチクエスチョン

  • RQ1生データを共有せずに、フェデレーテッドラーニングフレームワークを用いて解釈可能なスコアカードを訓練できるか?
  • RQ2境界付き制約を課した投影勾配法が、反復的ハイパーパrameterチューニングを回避する1回の学習セッションで高い性能を達成できるか?
  • RQ3複数機関間でのデータ統合による拡張が、クレジットスコアリングモデルのAUCおよびKS統計量を向上させるか?
  • RQ4FL-LRBC手法は、予測性能の向上を図る一方で、どの程度モデルの解釈可能性を維持できるか?
  • RQ5FL-LRBCの性能は、孤立したデータで訓練された従来のスコアカードモデルと比べてどのように異なるか?

主な発見

  • FL-LRBC手法は、平均テストAUCが72.6%に達し、非フェデレーテッドモデルに比べて相対的に9%の向上を示した。
  • KS統計量は60%向上し、0.41に達した。これは、延滞者と非延滞者をより強く識別できることを示している。
  • モデルは約30時間で訓練が完了し、従来の反復的チューニングおよび特徴選択に通常要する数百時間の計算時間と比べて大幅に削減された。
  • すべてのモデル係数が非負であったため、金融スコアカードで求められる解釈可能性と頑健性が保持された。
  • 銀行と決済会社のデータ統合により、単一機関のデータを使用した場合と比較して、モデルの安定性と性能が顕著に向上した。
  • 本手法は実用的かつスケーラブルであることが実証され、すでに全国規模の金融グループでの導入が進行中である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。