Skip to main content
QUICK REVIEW

[论文解读] Model-Agnostic Interpretable and Data-driven suRRogates suited for highly regulated industries.

Roel Henckaerts, Katrien Antonio|arXiv (Cornell University)|Jul 14, 2020
Explainable Artificial Intelligence (XAI)参考文献 16被引用 4
一句话总结

本文提出了一种模型无关、可解释且数据驱动的代理方法,适用于高度监管行业中的结构化表格数据。该方法利用部分依赖效应对特征空间进行分割,实现自动特征选择,并在分组后的分类特征及其交互项上训练一种透明的广义线性模型(GLM),在通用保险索赔频率案例研究中,其性能接近梯度提升机(GBM),同时超越了线性模型和树形代理模型。

ABSTRACT

Highly regulated industries, like banking and insurance, ask for transparent decision-making algorithms. At the same time, competitive markets push for sophisticated black box models. We therefore present a procedure to develop a Model-Agnostic Interpretable Data-driven suRRogate, suited for structured tabular data. Insights are extracted from a black box via partial dependence effects. These are used to group feature values, resulting in a segmentation of the feature space with automatic feature selection. A transparent generalized linear model (GLM) is fit to the features in categorical format and their relevant interactions. We demonstrate our R package maidrr with a case study on general insurance claim frequency modeling for six public datasets. Our maidrr GLM closely approximates a gradient boosting machine (GBM) and outperforms both a linear and tree surrogate as benchmarks.

研究动机与目标

  • 解决高度监管行业(如银行和保险)中监管透明性要求与高性能黑箱模型之间的矛盾。
  • 开发一种既可解释又能近似复杂黑箱模型的代理模型,且无需访问其内部结构。
  • 通过从部分依赖效应中提取的数据驱动洞察,实现自动特征选择与特征空间分割。
  • 提供一种实用且开源的解决方案(通过R包maidrr),用于构建在真实世界保险数据集上保持预测准确性的可解释模型。

提出的方法

  • 从黑箱模型中提取部分依赖效应,以理解全局特征对预测的影响。
  • 利用这些部分依赖效应将特征值分组为有意义的区间,实现对特征空间的数据驱动分割。
  • 基于分组特征及其交互项的重要性,实施自动特征选择。
  • 在分组后的分类特征和选定的交互项上训练一种透明的广义线性模型(GLM),以确保可解释性。
  • 通过不依赖对底层黑箱模型架构的假设,确保方法的模型无关性。
  • 在R包maidrr中实现完整流程,以实现在监管环境中的可重现与可访问部署。

实验结果

研究问题

  • RQ1一种基于数据驱动、模型无关的代理模型能否在保持可解释性的同时,实现与梯度提升机(GBM)相当的预测性能?
  • RQ2利用部分依赖效应进行特征空间分割及实现自动特征选择,在结构化表格数据中效果如何?
  • RQ3所得到的GLM代理模型在准确性和可解释性方面,相较于标准线性模型和基于树的代理模型,优势有多大?
  • RQ4该方法能否有效应用于包含多样化公开数据集的真实世界保险索赔频率预测任务?
  • RQ5该代理模型在确保监管合规透明性的同时,能否有效保留原始黑箱模型的预测行为?

主要发现

  • maidrr GLM代理模型在六个公开的通用保险索赔频率数据集上,其预测性能与梯度提升机(GBM)非常接近。
  • 在所有六个数据集上,maidrr代理模型在预测准确性方面均优于标准线性模型和基于树的代理模型。
  • 该方法通过部分依赖效应引导的数据驱动分割,成功识别出相关特征及其交互项。
  • 所得到的GLM模型具有内在可解释性,因此适用于高度监管行业中的监管审查。
  • 该方法实现了无需先验领域知识或人工特征工程的自动特征选择与分割。
  • R包maidrr提供了可重现且可访问的实现,便于在生产环境中部署可解释的代理模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。