[논문 리뷰] Synthesizing Property & Casualty Ratemaking Datasets using Generative Adversarial Networks.
이 논문은 기밀성 있는 자동차 및 손해보험 정책 데이터셋을 생성하면서 데이터 구조와 다변량 관계를 유지하는 데 세 가지 생성적 적대적 네트워크(GAN) 아키텍처—MC-WGAN-GP, CTGAN, MNCDP-GAN—을 제안한다. MC-WGAN-GP는 품질 면에서 가장 뛰어나 단변량 및 다변량 분포를 정밀하게 재현하지만, CTGAN은 가장 쉽게 구현할 수 있고, MNCDP-GAN은 차별적 프라이버시를 제공하지만 데이터 품질은 낮다.
Due to confidentiality issues, it can be difficult to access or share interesting datasets for methodological development in actuarial science, or other fields where personal data are important. We show how to design three different types of generative adversarial networks (GANs) that can build a synthetic insurance dataset from a confidential original dataset. The goal is to obtain synthetic data that no longer contains sensitive information but still has the same structure as the original dataset and retains the multivariate relationships. In order to adequately model the specific characteristics of insurance data, we use GAN architectures adapted for multi-categorical data: a Wassertein GAN with gradient penalty (MC-WGAN-GP), a conditional tabular GAN (CTGAN) and a Mixed Numerical and Categorical Differentially Private GAN (MNCDP-GAN). For transparency, the approaches are illustrated using a public dataset, the French motor third party liability data. We compare the three different GANs on various aspects: ability to reproduce the original data structure and predictive models, privacy, and ease of use. We find that the MC-WGAN-GP synthesizes the best data, the CTGAN is the easiest to use, and the MNCDP-GAN guarantees differential privacy.
연구 동기 및 목표
- 메서드 연구를 위한 기밀성 있는 자동차 및 손해보험 데이터셋에 접근이 제한된 문제를 해결하기 위해.
- 실제 청구 데이터의 통계적 구조와 관계를 유지하는 GAN 기반 방법을 개발하고 비교하기 위해.
- 정치적 데이터 합성에서 데이터 품질, 프라이버시 보호, 사용 용이성 간의 상호 상충 관계를 평가하기 위해.
- 공개 사용을 위한 재현 가능하고 오픈소스 프레임워크를 제공하기 위해.
제안 방법
- 기울기 페널티를 사용하여 훈련 안정성을 확보함으로써 이산형 및 혼합형 보험 데이터에 적합한 다중범주형 WGAN-GP(MC-WGAN-GP)를 적용한다.
- 조건부 노이즈 주입을 통해 샘플 다양성을 향상시켜 표본 보험 데이터를 생성하기 위해 조건부 테이블 GAN(CTGAN)을 활용한다.
- 강력한 프라이버시 보장을 보장하기 위해 오토인코더 아키텍처를 갖춘 차별적 프라이버시를 갖춘 GAN인 MNCDP-GAN을 도입한다.
- 훈련 및 평가의 공개 기준으로 프랑스 자동차 제3자 책임(MTPL) 데이터셋을 사용한다.
- 단변량 분포 일치, 다변량 관계 유지, 예측 모델 일관성 등의 지표를 사용하여 합성 데이터 품질을 평가한다.
- 예측 성능 비교를 위해 포isson GLM 피팅 및 예측 오차 분석(MAE, MSE)을 실재 데이터와 합성 데이터 간에 수행한다.
실험 결과
연구 질문
- RQ1GAN 기반 방법은 실제 자동차 및 손해보험 데이터셋의 단변량 및 다변량 통계적 구조를 얼마나 잘 유지할 수 있는가?
- RQ2보험 데이터 합성에서 다양한 GAN 아키텍처 간에 데이터 품질, 프라이버시 보호, 사용 용이성 간의 상호 상충 관계는 어떠한가?
- RQ3GAN이 생성한 합성 데이터는 후속 작업에서의 예측 성능을 기준으로 신뢰할 수 있는 모델 훈련과 예측을 지원할 수 있는가?
- RQ4차별적 프라이버시 메커니즘은 합성 보험 데이터의 품질과 유용성에 어떤 영향을 미치는가?
주요 결과
- MC-WGAN-GP는 프랑스 MTPL 데이터셋의 단변량 및 다변량 분포를 가장 정확하게 재현하였으며, 특히 범주형 그룹 간의 청구 확률을 잘 반영하였다.
- CTGAN은 사용자 친화도가 가장 높았고, 특히 R 사용자에게 유용했으며, 품질 면에서 MC-WGAN-GP에 이어 두 번째로 높은 품질의 합성 데이터를 생성하였다.
- MNCDP-GAN은 강력한 차별적 프라이버시 보장을 제공했지만, 프라이버시 메커니즘을 활성화하지 않은 상태에서도 가장 낮은 품질의 데이터를 생성하였다.
- 평균적으로 MC-WGAN-GP는 청구 수 예측에서 중앙값 절대오차(MAE) 5.0(95% 신뢰구간: 4.68–5.44) 및 평균제곱오차(MSE) 0.08(95% 신뢰구간: 0.06–0.10)를 기록하여 CTGAN(MAE: 10.8, MSE: 0.38)과 MNCDP-GAN(MAE: 32.8, MSE: 3.36)을 크게 앞섰다.
- MC-WGAN-GP와 CTGAN 모두 청구 수가 1인 경우의 수를 정확히 재현하였지만, MC-WGAN-GP는 분포의 나머지 부분 형태를 더 잘 포착하였다.
- CTGAN의 합성 데이터 기반 회귀 계수는 실재 데이터의 계수에 가장 가까웠고, MC-WGAN-GP는 유일한 지역 계수를 제외하고는 미미한 편차를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.