[논문 리뷰] A Vertical Federated Learning Method for Interpretable Scorecard and Its Application in Credit Scoring
이 논문은 계약자 간의 개인정보 보호 협업을 가능하게 하면서 제한된 계수를 갖는 해석 가능한 로지스틱 회귀 스코어카드를 훈련하기 위한 수직 연합 학습 방법인 FL-LRBC를 제안한다. 단일 훈련 세션에서 투영된 기울기 기반 최적화를 사용함으로써, 반복적인 하이퍼파rameter 튜닝이나 데이터 공유 없이도 비연합 모델 대비 AUC(+9%)와 KS 통계량(+60%)에서 뚜렷한 향상을 이룬다.
With the success of big data and artificial intelligence in many fields, the applications of big data driven models are expected in financial risk management especially credit scoring and rating. Under the premise of data privacy protection, we propose a projected gradient-based method in the vertical federated learning framework for the traditional scorecard, which is based on logistic regression with bounded constraints, namely FL-LRBC. The latter enables multiple agencies to jointly train an optimized scorecard model in a single training session. It leads to the formation of the model with positive coefficients, while the time-consuming parameter-tuning process can be avoided. Moreover, the performance in terms of both AUC and the Kolmogorov-Smirnov (KS) statistics is significantly improved due to data enrichment using FL-LRBC. At present, FL-LRBC has already been applied to credit business in a China nation-wide financial holdings group.
연구 동기 및 목표
- 금융 리스크 관리에서 데이터 프라이버시를 유지하면서도 해석 가능하고 높은 성능을 갖는 스코어카드를 훈련하는 데 도전하는 것.
- 기존 스코어카드 모델링에서 반복적인 특성 선택 및 하이퍼파rameter 튜닝 과정을 제거하는 것.
- 원시 데이터를 공유하지 않고도 여러 금융 기관이 동일한 최적화된 스코어카드 모델을 공동으로 훈련할 수 있도록 하는 것.
- 로지스틱 회귀에서 비음수이자 제한된 계수를 통해 모델의 해석 가능성과 강건성을 유지하는 것.
- 국내 금융 그룹의 실세계 데이터(은행과 결제 기업 포함)를 대상으로 제안된 방법의 성능을 평가하는 것.
제안 방법
- 수직 연합 학습 프레임워크 내에서 제한된 제약 조건이 있는 로지스틱 회귀에 대한 투영 기반 기울기 최적화 방법(FL-LRBC)을 제안한다.
- FATE 연합 학습 플랫폼에 이를 구현하여 데이터 제공자 간의 안전하고 분산된 훈련을 가능하게 한다.
- 모델의 해석 가능성 향상을 위해 원시 변수를 정보 기반 특성으로 변환하기 위해 가중치의 증거(WOE) 변환을 적용한다.
- 최적화 과정에서 비음수 계수 제약 조건을 강제 적용하여 모델의 해석 가능성과 강건성을 확보한다.
- 반복적인 튜닝을 피하기 위해 단일 훈련 세션을 사용함으로써 기존 접근 방식에 비해 계산 비용을 크게 절감한다.
- 다른 기관이 서로 다른 특성 세트를 기여하는 수직 FL 설정을 활용하며, 직접적인 데이터 교환은 이루어지지 않는다.
실험 결과
연구 질문
- RQ1원시 데이터를 공유하지 않고도 연합 학습 프레임워크를 활용해 해석 가능한 스코어카드를 훈련시킬 수 있는가?
- RQ2제한된 제약 조건이 있는 투영 기반 기울기 방법이 단일 훈련 세션에서 반복적인 하이퍼파rameter 튜닝 없이도 높은 성능을 달성할 수 있는가?
- RQ3기관 간 협업을 통한 데이터 강화가 신용 스코어링 모델의 AUC와 KS 통계량을 향상시키는가?
- RQ4FL-LRBC 방법은 예측 성능 향상과 함께 모델의 해석 가능성은 어느 정도 유지하는가?
- RQ5FL-LRBC의 성능은 고립된 데이터로 훈련된 전통적 스코어카드 모델과 비교해 어떻게 되는가?
주요 결과
- FL-LRBC 방법은 평균 테스트 AUC 72.6%를 기록하여 비연합 모델 대비 9% 상대적 향상을 이뤘다.
- KS 통계량은 60% 향상되어 0.41에 도달했으며, 이는 지급 불능자와 지급 가능자 간의 구분 능력 향상을 시사한다.
- 모델 훈련은 약 30시간 내로 완료되었으며, 기존 방법에서 일반적으로 요구되는 수백 시간 분량의 반복 튜닝 및 특성 선택 과정을 피했다.
- 모든 모델 계수는 비음수였으며, 금융 스코어카드에서 요구하는 해석 가능성과 강건성을 유지했다.
- 은행과 결제 기업의 데이터 통합은 단일 기관의 데이터를 사용한 경우에 비해 모델의 안정성과 성능을 크게 향상시켰다.
- 이 방법은 실용성과 확장성을 입증하였으며, 현재 전국 규모의 금융 지주회사에서 이미 구현을 위한 준비가 진행 중이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.