[論文レビュー] Prediction of motor insurance claims occurrence as an imbalanced machine learning problem
本研究では、実世界のデータセットを用いて、ロジスティック回帰、意思決定木、ランダムフォレスト、XGBoost、ディープラーニングなどの複数の機械学習モデルを用いて、自動車保険の補償請求予測におけるデータの不均衡問題に取り組んだ。SMOTEオーバーサンプリングとハイパーパrameterチューニングを適用した後、XGBoostおよびディープラーニングモデルが最高のAUC(0.6439)とAUPRC(0.2629)を達成し、データの不均衡下でのレアイベント請求予測において、アンサンブル法およびニューラルネットワーク手法が従来のモデルを上回ることを示した。
The insurance industry, with its large datasets, is a natural place to use big data solutions. However it must be stressed, that significant number of applications for machine learning in insurance industry, like fraud detection or claim prediction, deals with the problem of machine learning on an imbalanced data set. This is due to the fact that frauds or claims are rare events when compared with the entire population of drivers. The problem of imbalanced learning is often hard to overcome. Therefore, the main goal of this work is to present and apply various methods of dealing with an imbalanced dataset in the context of claim occurrence prediction in car insurance. In addition, the above techniques are used to compare the results of machine learning algorithms in the context of claim occurrence prediction in car insurance. Our study covers the following techniques: logistic-regression, decision tree, random forest, xgBoost, feed-forward network. The problem is the classification one.
研究の動機と目的
- 補償請求がレアイベントであるため、データの不均衡問題に取り組むこと。
- ロジスティック回帰、意思決定木、ランダムフォレスト、XGBoost、ディープラーニングといった多様な機械学習モデルの性能を、この不均衡分類タスクにおいて評価・比較すること。
- データレベル(SMOTE)およびアルゴリズムレベル(クラスウェイト)の技術が、稀な補償請求イベントの予測性能に与える影響を評価すること。
- 現実世界の損害保険データセットにおける補償請求発生の予測に、最も頑健で正確なモデルを特定すること。
提案手法
- データセットにおける少数クラス(補償請求)のバランスをとるために、SMOTEオーバーサンプリングを適用した。
- すべてのモデルに対して、SklearnのGridSearchCVおよびKeras TunerのHyperbandを用いてハイパーパrameterチューニングを実施した。
- XGBoostおよびディープラーニングモデルにクラスウェイトを適用して、クラスの不均衡に対応した。
- ロジスティック回帰、意思決定木、ランダムフォレスト、XGBoost、フィードフォワードニューラルネットワークの複数のモデルを訓練・評価した。
- 標準指標(正解率、F1スコア、適合率、再現率、AUC、AUPRC)を用いてモデルを評価した。
- モデル解釈のため、木ベースのモデル(XGBoost、ランダムフォレスト)を用いた特徴量重要度の可視化および混同行列の可視化を実施した。
実験結果
リサーチクエスチョン
- RQ1不均衡データセットにおける稀な保険補償請求イベントの予測において、どの機械学習モデルが最も優れた性能を示すか?
- RQ2データレベル(SMOTE)およびアルゴリズムレベル(クラスウェイト)の技術が、補償請求予測におけるモデル性能にどのように影響を与えるか?
- RQ3ハイパーパrameterチューニングは、この不均衡な設定下で、異なるアルゴリズムのモデル性能にどのように影響を与えるか?
- RQ4XGBoostやランダムフォレストのような木ベースのモデルにおいて、特徴量重要度の順位付けは、補償請求予測の文脈でどのように異なるか?
主な発見
- ハイパーパrameterチューニングおよびクラスウェイトを適用した後、XGBoostは最高のF1スコア(0.3549)とAUC(0.6227)を達成し、他のモデルを上回った。
- SMOTEおよびクラスウェイトを適用した後、ディープラーニングモデルは最高のAUPRC(0.2629)とAUC(0.6439)を達成し、稀イベント検出において優れた性能を示した。
- ランダムフォレストはAUCが0.6204、AUPRCが0.2784と強く、ディープラーニングに次いでAUPRCで2位となった。
- ロジスティック回帰は性能が低く、F1スコアが0.2421、AUCが0.5407にとどまり、重度のクラス不均衡に対処する際の限界を示した。
- SMOTEおよびクラスウェイトの適用により、特に少数クラスの補償請求を検出する能力が、木ベースのモデルで顕著に向上した。
- 特徴量重要度分析から、ドライブ履歴および車両の特徴が上位の予測要因であることが判明し、保険数理の直感と整合的であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。