Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning with High-Cardinality Categorical Features in Actuarial Applications

Benjamin Avanzi, G. B. Taylor|arXiv (Cornell University)|Jan 30, 2023
Insurance, Mortality, Demography, Risk Management被引用数 4
ひとこと要約

本稿では、一般化線形混合モデル(GLMM)とディープラーニングを統合することで、保険データにおける高基数のカテゴリカル特徴をモデル化する、GLMMNetと呼ばれる新しいニューラルネットワークアーキテクチャを提案する。変分推論を用いることで複雑な応答分布を扱い、解釈可能なランダム効果を維持することで、エンティティ埋め込みニューラルネットワークと同等またはそれ以上の予測性能を達成するとともに、透明性と確率的不確実性推定を提供する。

ABSTRACT

High-cardinality categorical features are pervasive in actuarial data (e.g. occupation in commercial property insurance). Standard categorical encoding methods like one-hot encoding are inadequate in these settings. In this work, we present a novel _Generalised Linear Mixed Model Neural Network_ ("GLMMNet") approach to the modelling of high-cardinality categorical features. The GLMMNet integrates a generalised linear mixed model in a deep learning framework, offering the predictive power of neural networks and the transparency of random effects estimates, the latter of which cannot be obtained from the entity embedding models. Further, its flexibility to deal with any distribution in the exponential dispersion (ED) family makes it widely applicable to many actuarial contexts and beyond. We illustrate and compare the GLMMNet against existing approaches in a range of simulation experiments as well as in a real-life insurance case study. Notably, we find that the GLMMNet often outperforms or at least performs comparably with an entity embedded neural network, while providing the additional benefit of transparency, which is particularly valuable in practical applications. Importantly, while our model was motivated by actuarial applications, it can have wider applicability. The GLMMNet would suit any applications that involve high-cardinality categorical variables and where the response cannot be sufficiently modelled by a Gaussian distribution.

研究の動機と目的

  • 保険データに一般的に見られる高基数カテゴリカル特徴のモデル化におけるワンホットエンコーディングおよびエンティティ埋め込みの限界を克服すること。
  • ブラックボックスなニューラルネットワーク埋め込みの解釈不能性を克服しつつ、予測力は維持すること。
  • LMMNNフレームワークを、指数分散族の全分布をサポートするように拡張し、歪度のある保険データのより良いモデル化を可能にすること。
  • 不均一なカテゴリ分布を示す大規模かつ高基数のカテゴリカル変数を効率的に処理する計算効率の良い手法を開発すること。
  • 保険応用分野における既存のディープラーニングモデルの代替として、透明性、解釈可能性、柔軟性を備えた代替手法を提供すること。

提案手法

  • 高基数カテゴリカル特徴をランダム効果として扱うことで、一般化線形混合モデル(GLMM)をディープニューラルネットワークフレームワークに統合する。
  • 元のLMMNNにおけるカテゴリカル特徴の非線形変換を置き換え、ランダム効果推定値の解釈可能性を保つ。
  • GLMMにおける扱いにくい尤度積分を近似するために変分推論を用い、非正規応答分布を伴う効率的な学習を可能にする。
  • 応答変数が指数分散族(例:ポアソン分布、ガンマ分布、ベルヌーイ分布)の任意の分布に従うことを許容し、保険データへの適用性を高める。
  • バックプロパゲーションを用いてエンドツーエンドで学習し、確率的勾配降下法と正則化を用いて過学習を防止する。
  • ランダム効果の事後予測分布を通じて確率的予測を可能にし、ランダム効果の不確実性推定を含む。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドニューラルネットワーク–GLMMモデルは、高基数カテゴリカル特徴の予測精度において、標準的なエンティティ埋め込みニューラルネットワークを上回ることができるか?
  • RQ2ブラックボックスな埋め込みと比較して、GLMMNetモデルは透明なランダム効果推定値によってどれほど解釈可能性を維持しているか?
  • RQ3GLMMNetは、保険データに一般的な応答分布(例:ポアソン分布、ガンマ分布、ベルヌーイ分布)において、どれほど良好に機能するか?
  • RQ4変分推論は、扱いにくい尤度を効率的かつ正確に近似できるか、計算効率とモデルの正確性を維持できるか?
  • RQ5正則化が適用された状況でも、GLMMNetモデルは低信号対雑音比環境において頑健性を保つことができるか?

主な発見

  • GLMMNetは、複数のシミュレーション実験および実世界の保険事例研究において、エンティティ埋め込みニューラルネットワークと同等またはそれを上回る性能を一貫して示す。
  • 歪度があり過分散を示す応答変数(例:事故件数、被害額)を伴う高基数設定において、優れた予測性能を達成する。
  • GLMMNetのランダム効果推定値は解釈可能であり、統計的推論(例:リスクが著しく高いまたは低い職業を同定する)が可能である。これは、標準的なエンティティ埋め込みでは実現できない。
  • 変分推論の使用により、解析的尤度解がない複雑な分布(例:ガンマ分布、ポアソン分布)を伴う効率的学習が可能になり、モデルの適用範囲が広がる。
  • GLMMNetにおける正則化は、信号対雑音比が低い環境でもモデル性能を回復させ、ブースティングモデルが支配的になるのを防ぐ。
  • モデルは有効な確率的予測を生成し、ランダム効果の95%信用区間を含む不確実性推定を提供するため、リスク評価および意思決定支援における実用性が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。