[논문 리뷰] Using generative adversarial networks to synthesize artificial financial datasets
이 논문은 실세계의 신용 및 사기 위험 데이터 분포를 밀도 높게 재현하는 고해상도 인공 금융 데이터셋을 합성하기 위해 새로운 조건부 DRAGAN 기반 GAN 아키텍처를 제안한다. 세 개의 American Express 데이터셋으로 훈련된 GAN에 의해 생성된 데이터는 특성 분포, 다변량 구조 및 모델 성능 면에서 실제 데이터와 유사했으며, 인공 데이터로 훈련된 지도 학습 모델은 실제 데이터로 훈련된 모델의 AUC 점수와 3-5% 이내로 유사한 성능을 보였다.
Generative Adversarial Networks (GANs) became very popular for generation of realistically looking images. In this paper, we propose to use GANs to synthesize artificial financial data for research and benchmarking purposes. We test this approach on three American Express datasets, and show that properly trained GANs can replicate these datasets with high fidelity. For our experiments, we define a novel type of GAN, and suggest methods for data preprocessing that allow good training and testing performance of GANs. We also discuss methods for evaluating the quality of generated data, and their comparison with the original real data.
연구 동기 및 목표
- 신용 및 사기 위험 관리 분야에서 기계 학습 모델을 벤치마킹하기 위한 공개 가능하고 고품질의 금융 데이터셋 부족 문제를 해결하기 위해.
- 실제 금융 데이터의 통계적 특성과 복잡한 관계를 유지하는 인공 금융 데이터 생성 방법을 개발하기 위해.
- GAN에 의해 생성된 데이터로 훈련된 기계 학습 모델이 실제 데이터로 훈련된 모델과 비교해 유사한 성능을 달성할 수 있는지 평가하기 위해.
- 실제 고객으로부터 유래하지 않는 인공 데이터를 생성함으로써 데이터 프라이버시를 확보하고, 공개 공유를 가능하게 하기 위해.
제안 방법
- 훈련 안정성과 생성 품질 향상을 위해 조건부 GAN과 DRAGAN을 융합한 새로운 GAN 아키텍처를 제안하였다.
- 정규화, 원핫 인코딩, 기울어진 및 범주형 특성 처리와 같은 데이터 전처리 기법을 적용하여 GAN 훈련 및 테스트 성능을 향상시켰다.
- 실제 데이터와 생성된 데이터 간의 유사도를 단변량 및 다변량 분포 전반에서 정량적으로 평가하기 위해 DataQC 툴킷을 사용하였다.
- 저차원 공간에서 실제 데이터와 생성된 데이터의 전반적인 구조 및 군집 구조를 비교하기 위해 t-SNE 시각화를 적용하였다.
- 실제 데이터와 GAN에 의해 생성된 데이터 양쪽 모두에 동일한 초모수를 사용하여 동일한 지도 학습 모델을 훈련시켜 직접 성능 비교를 수행하였다.
- 일반화 능력과 인공 데이터의 정밀도를 평가하기 위해, 외부 샘플 실데이터에 대한 AUC를 측정하여 모델 성능을 측정하였다.
실험 결과
연구 질문
- RQ1GAN 아키텍처가 실제 금융 데이터셋에 존재하는 복잡한 통계적 분포와 관계를 효과적으로 학습하고 재현할 수 있는가?
- RQ2GAN에 의해 생성된 금융 데이터로 훈련된 기계 학습 모델이 실제 데이터로 훈련된 모델과 얼마나 유사한 성능을 보이는가?
- RQ3고차원적이고 이질적인 금융 데이터에서 GAN 훈련 및 생성 품질 향상을 위해 데이터 전처리는 어떻게 최적화될 수 있는가?
- RQ4실제 데이터와 비교해 인공 금융 데이터의 정밀도를 신뢰성 있게 평가할 수 있는 정량적 및 정성적 지표는 무엇인가?
주요 결과
- 제안된 조건부 DRAGAN 기반 GAN은 세 개의 실제 American Express 데이터셋의 단변량 및 다변량 분포를 높은 정밀도로 재현하였다.
- 생성된 데이터의 특성 히스토그램은 기울어진, 이진형, 다중모달 분포를 포함한 실제 데이터의 히스토그램과 거의 일치했으며, 연속형 특성에서 약간의 부드러움만 관찰되었다.
- t-SNE 시각화 결과, 생성된 데이터는 실제 데이터의 전반적인 구조, 군집화 및 밀도 패턴을 유지하고 있음을 확인하였다.
- 인공 데이터로 훈련된 지도 학습 모델은 실제 데이터로 훈련된 모델의 AUC 점수와 3-5% 이내로 유사한 성능을 보였다. 각각 Dataset A: 0.66 vs. 0.63, Dataset B: 0.80 vs. 0.78, Dataset C: 0.89 vs. 0.86.
- 실제 데이터와 인공 데이터로 훈련된 모델 간의 성능 격차는 미미했으며, 이는 인공 데이터가 금융 기계 학습 연구의 신뢰할 수 있는 기준점이 될 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.