[论文解读] Machine Learning with High-Cardinality Categorical Features in Actuarial Applications
本文提出 GLMMNet,一种新颖的神经网络架构,将广义线性混合模型(GLMMs)与深度学习相结合,用于对精算数据中的高基数分类特征进行建模。通过使用变分推断处理复杂的响应分布,并保留可解释的随机效应,GLMMNet 在预测性能上与或优于实体嵌入神经网络,同时提供透明性及概率不确定性估计。
High-cardinality categorical features are pervasive in actuarial data (e.g. occupation in commercial property insurance). Standard categorical encoding methods like one-hot encoding are inadequate in these settings. In this work, we present a novel _Generalised Linear Mixed Model Neural Network_ ("GLMMNet") approach to the modelling of high-cardinality categorical features. The GLMMNet integrates a generalised linear mixed model in a deep learning framework, offering the predictive power of neural networks and the transparency of random effects estimates, the latter of which cannot be obtained from the entity embedding models. Further, its flexibility to deal with any distribution in the exponential dispersion (ED) family makes it widely applicable to many actuarial contexts and beyond. We illustrate and compare the GLMMNet against existing approaches in a range of simulation experiments as well as in a real-life insurance case study. Notably, we find that the GLMMNet often outperforms or at least performs comparably with an entity embedded neural network, while providing the additional benefit of transparency, which is particularly valuable in practical applications. Importantly, while our model was motivated by actuarial applications, it can have wider applicability. The GLMMNet would suit any applications that involve high-cardinality categorical variables and where the response cannot be sufficiently modelled by a Gaussian distribution.
研究动机与目标
- 解决在精算数据中常见的高基数分类特征建模中,独热编码和实体嵌入方法的局限性。
- 克服黑箱神经网络嵌入缺乏可解释性的问题,同时保持其预测能力。
- 将 LMMNN 框架扩展至支持整个指数分散族分布,以更好地建模偏态保险数据。
- 开发一种计算高效的处理大规模、高基数分类变量且类别分布不均的方法。
- 为精算应用中的现有深度学习模型提供一种透明、可解释且灵活的替代方案。
提出的方法
- 将广义线性混合模型(GLMM)整合进深度神经网络框架中,将高基数分类特征视为随机效应。
- 在原始 LMMNN 中替换对分类特征的非线性变换,以保持随机效应估计的可解释性。
- 使用变分推断近似 GLMM 中难以计算的似然积分,实现非高斯响应分布下的高效训练。
- 允许响应变量服从指数分散族中的任意分布(例如泊松分布、伽马分布、伯努利分布),增强其在精算数据中的适用性。
- 使用反向传播进行端到端训练,结合随机梯度下降与正则化以防止过拟合。
- 通过后验预测分布实现概率预测,包括对随机效应的不确定性估计。
实验结果
研究问题
- RQ1混合神经网络-GLMM 模型是否能在高基数分类特征的预测准确率上超越标准实体嵌入神经网络?
- RQ2与黑箱嵌入相比,GLMMNet 模型在多大程度上通过透明的随机效应估计保持了可解释性?
- RQ3GLMMNet 在精算数据中常见的不同响应分布(如泊松分布、伽马分布、伯努利分布)下的表现如何?
- RQ4变分推断是否能有效近似 GLMM 中难以计算的似然,同时保持计算效率和模型准确性?
- RQ5当应用正则化时,GLMMNet 模型在低信噪比环境下是否仍保持鲁棒性,特别是在提升模型可能占主导地位的情况下?
主要发现
- 在多个模拟实验和一个真实世界的保险案例研究中,GLMMNet 的表现始终优于或等同于实体嵌入神经网络。
- 在具有偏态、过度分散响应变量(如索赔次数和严重程度)的高基数场景下,该模型实现了更优的预测性能。
- GLMMNet 的随机效应估计具有可解释性,可支持统计推断,例如识别出风险显著更高或更低的职业,而这是标准实体嵌入无法实现的。
- 使用变分推断使模型能够高效训练复杂分布(如伽马分布、泊松分布)而无需解析似然解,从而扩大了模型的适用范围。
- GLMMNet 中的正则化在低信噪比环境下恢复了模型性能,避免了提升模型可能带来的主导效应。
- 该模型生成了有效的概率预测,包括对随机效应的 95% 可信区间,显著增强了其在风险评估和决策制定中的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。