[論文レビュー] Synthesizing Property & Casualty Ratemaking Datasets using Generative Adversarial Networks.
本稿では、データ構造と多次元的関係を保持しながら機密性の高い損害保険のレート設定データセットを合成する3つの生成的敵対的ネットワーク(GAN)アーキテクチャ—MC-WGAN-GP、CTGAN、MNCDP-GAN—を提案する。MC-WGAN-GPは忠実度において他のモデルを上回り、一変量および多次元分布をきわめて正確に再現するが、CTGANは実装が最も簡単で、MNCDP-GANは微分プライバシーを提供するが、データ品質は低い。
Due to confidentiality issues, it can be difficult to access or share interesting datasets for methodological development in actuarial science, or other fields where personal data are important. We show how to design three different types of generative adversarial networks (GANs) that can build a synthetic insurance dataset from a confidential original dataset. The goal is to obtain synthetic data that no longer contains sensitive information but still has the same structure as the original dataset and retains the multivariate relationships. In order to adequately model the specific characteristics of insurance data, we use GAN architectures adapted for multi-categorical data: a Wassertein GAN with gradient penalty (MC-WGAN-GP), a conditional tabular GAN (CTGAN) and a Mixed Numerical and Categorical Differentially Private GAN (MNCDP-GAN). For transparency, the approaches are illustrated using a public dataset, the French motor third party liability data. We compare the three different GANs on various aspects: ability to reproduce the original data structure and predictive models, privacy, and ease of use. We find that the MC-WGAN-GP synthesizes the best data, the CTGAN is the easiest to use, and the MNCDP-GAN guarantees differential privacy.
研究の動機と目的
- 手法的研究に向けた機密性の高い損害保険データセットへのアクセス制限という課題に対処すること。
- 実際の請求データの統計的構造と関係性を保持するGANベースの手法を開発・比較すること。
- 精査師的データ合成におけるデータ忠実度、プライバシー保護、実装のしやすさのトレードオフを評価すること。
- 公開利用を想定した再現可能でオープンソースのフレームワークを提供すること。
提案手法
- 勾配ペナルティを用いることで訓練安定性を向上させ、多カテゴリー型WGAN-GP(MC-WGAN-GP)を離散的および混合型の保険データに適応させた。
- 条件付きノイズ注入を用いてサンプルの多様性を向上させることで、表形式の保険データを生成する条件付きタブルGAN(CTGAN)を採用した。
- 自己符号化器アーキテクチャを備えた微分プライバシーを備えたGAN、すなわちMNCDP-GANを提案し、強固なプライバシー保証を実現した。
- トレーニングおよび評価のための公開ベンチマークとして、フランスの自動車第三者的責任(MTPL)データセットを用いた。
- 一変量分布マッチング、多次元的関係の保持、予測モデルの一貫性といった指標を用いて、合成データの品質を評価した。
- ポisson GLMのフィッティングと予測誤差分析(MAE、MSE)を用い、実データと合成データにおけるモデル性能を比較した。
実験結果
リサーチクエスチョン
- RQ1GANベースの手法は、実際の損害保険データセットの一変量および多次元的統計的構造をどの程度正確に保持できるか?
- RQ2精査師的データ合成において、異なるGANアーキテクチャ間で、データ忠実度、プライバシー保護、使いやすさのトレードオフはどのように変化するか?
- RQ3GANによって生成された合成データは、下流タスクにおける予測性能を測定することで、信頼できるモデルのトレーニングと予測を可能にするか?
- RQ4微分プライバシー機構は、合成保険データの品質と有用性にどのような影響を与えるか?
主な発見
- MC-WGAN-GPが生成した合成データは、フランスMTPLデータセットの元の分布と一変量および多次元分布において最もよく一致しており、特にカテゴリー群ごとの請求確率を的確に再現していた。
- CTGANは最も使いやすいモデルであり、特にRユーザーにとって優れていた。また、高品質な合成データを生成しており、MC-WGAN-GPに次いで優れた性能を示した。
- MNCDP-GANは強固な微分プライバシー保証を提供したが、プライバシー機構を有効化していない状態でも、データの忠実度が最も低かった。
- 平均して、MC-WGAN-GPは請求件数予測において中央絶対誤差(MAE)5.0(95%信頼区間:4.68–5.44)および平均二乗誤差(MSE)0.08(95%信頼区間:0.06–0.10)を達成し、CTGAN(MAE:10.8、MSE:0.38)およびMNCDP-GAN(MAE:32.8、MSE:3.36)を顕著に上回った。
- MC-WGAN-GPとCTGANの両方とも、請求件数が1件の割合を正確に再現していたが、MC-WGAN-GPは分布の残りの形状をよりよく捉えていた。
- CTGANの合成データ上での回帰係数は、実データからのものに最も近かった。MC-WGAN-GPは、1つの地域係数を除き、わずかなずれを示したにとどまった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。