Skip to main content
QUICK REVIEW

[论文解读] Rethinking Representations in P&C Actuarial Science with Deep Neural Networks

Christopher Blier-Wong, Jean-Thomas Baillargeon|arXiv (Cornell University)|Feb 11, 2021
Machine Learning in Healthcare参考文献 48被引用 5
一句话总结

本文提出了一种统一框架,通过基于深度神经网络的表征学习,将文本、图像和地理信息等多样化、非向量化的数据整合到传统的财产与意外伤害(P&C)保险定价模型中。通过使用自编码器和卷积网络等模型将原始数据转换为密集向量嵌入,该方法实现了与标准广义线性模型(GLMs)的兼容性,从而在保持统计可解释性的同时,提高了预测准确性,并减少了表征中的空间不连续性。

ABSTRACT

Insurance companies gather a growing variety of data for use in the insurance process, but most traditional ratemaking models are not designed to support them. In particular, many emerging data sources (text, images, sensors) may complement traditional data to provide better insights to predict the future losses in an insurance contract. This paper presents some of these emerging data sources and presents a unified framework for actuaries to incorporate these in existing ratemaking models. Our approach stems from representation learning, whose goal is to create representations of raw data. A useful representation will transform the original data into a dense vector space where the ultimate predictive task is simpler to model. Our paper presents methods to transform non-vectorial data into vectorial representations and provides examples for actuarial science.

研究动机与目标

  • 解决在传统P&C保险定价模型中整合非结构化和新兴数据源(如文本、图像和传感器数据)日益增长的挑战。
  • 克服经典定价模型的局限性,这些模型依赖于向量输入,无法原生处理非向量数据(如GPS坐标、文本或图像)。
  • 开发一种表征学习框架,将原始非向量数据转换为适合用于广义线性模型(GLMs)的密集、低维嵌入。
  • 在通过更丰富、学习得到的复杂数据表征提升预测性能的同时,保持GLMs的统计可解释性和稳健性。
  • 提供一种可扩展、模块化的流水线,将表征学习与下游建模分离,从而在精算应用中灵活整合多源数据。

提出的方法

  • 该框架将表征学习阶段与预测建模阶段解耦,使用编码器将原始数据转换为向量嵌入。
  • 对于文本数据,该方法采用基于神经网络的嵌入(例如,句子编码器)将非结构化文本转换为密集向量。
  • 对于地理数据,采用卷积区域自编码器(CRAE)通过邻近地理特征将空间点模式转换为基于网格的表示。
  • CRAE模型从风险位置周围的普查数据和空间数据构建一个数据方柱体,尺寸为 q×q×p,其中 p 为每个网格单元的特征数。
  • CRAE的编码器组件通过卷积自编码器架构压缩网格数据,学习到一个紧凑的表征 x* ∈ R^ℓ。
  • 最终表征被输入标准GLM进行定价,既保留了统计特性,又受益于更丰富的输入特征。

实验结果

研究问题

  • RQ1如何有效将文本、图像和GPS坐标等非向量数据转换为适合传统基于GLM的P&C保险定价模型的向量表示?
  • RQ2哪些表征学习技术能够生成空间上平滑且鲁棒的嵌入,以避免因行政边界或不一致的地理编码导致的不连续性?
  • RQ3学习得到的嵌入在多大程度上能提升精算定价的预测性能,同时保持GLMs的可解释性和统计有效性?
  • RQ4如何将多源数据(如人口统计、地理和车联网数据)统一在一个单一的表征框架下用于精算建模?
  • RQ5是否可以设计出模块化且与现有精算工作流程兼容的表征学习框架,而无需对定价模型进行全栈重构?

主要发现

  • 通过深度神经网络进行表征学习,与传统地理编码方法相比,显著减少了嵌入中的空间不连续性,尤其是在使用GPS坐标而非邮政编码时。
  • 卷积区域自编码器(CRAE)通过利用邻近空间特征和基于网格的表示,生成了更平滑、更连贯的地理嵌入。
  • CRAE生成的嵌入在下游回归任务中表现出更优性能,具有更低的噪声和更好的空间区域泛化能力。
  • 该框架成功地将多种数据类型(包括文本、图像和传感器数据)整合为统一的向量格式,与标准基于GLM的定价模型兼容。
  • 该方法在保持GLMs统计特性的同时,使复杂、高维数据得以使用,从而在不牺牲模型可解释性的情况下提高了预测准确性。
  • 实证评估表明,学习得到的表征在捕捉风险异质性方面优于原始特征或人工构造的特征,尤其在低曝光或数据稀疏的业务领域中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。