Skip to main content
QUICK REVIEW

[論文レビュー] Model-Agnostic Interpretable and Data-driven suRRogates suited for highly regulated industries.

Roel Henckaerts, Katrien Antonio|arXiv (Cornell University)|Jul 14, 2020
Explainable Artificial Intelligence (XAI)参考文献 16被引用数 4
ひとこと要約

この論文は、規制が厳しい業界における構造的テーブルデータに対して、モデルに依存せず、解釈可能でデータ駆動型の代替手法を提案する。部分的依存効果を用いて特徴量空間をセグメント化し、自動特徴量選択を実施。その後、グループ化されたカテゴリカル特徴量と相互作用項を用いて、透明性の高い一般化線形モデル(GLM)を訓練する。その結果、勾配ブースティングマシン(GBM)に近い性能を達成した一方で、線形モデルおよび木ベースの代替モデルを上回った。一般保険の損害発生頻度に関する事例研究で検証された。

ABSTRACT

Highly regulated industries, like banking and insurance, ask for transparent decision-making algorithms. At the same time, competitive markets push for sophisticated black box models. We therefore present a procedure to develop a Model-Agnostic Interpretable Data-driven suRRogate, suited for structured tabular data. Insights are extracted from a black box via partial dependence effects. These are used to group feature values, resulting in a segmentation of the feature space with automatic feature selection. A transparent generalized linear model (GLM) is fit to the features in categorical format and their relevant interactions. We demonstrate our R package maidrr with a case study on general insurance claim frequency modeling for six public datasets. Our maidrr GLM closely approximates a gradient boosting machine (GBM) and outperforms both a linear and tree surrogate as benchmarks.

研究の動機と目的

  • 銀行や保険など規制が厳しい分野における、規制上の透明性要請と高精度なブラックボックスモデルのニーズの間にある葛藤を解消すること。
  • 内部構造の詳細を必要とせず、複雑なブラックボックスモデルを近似可能な解釈可能な代替モデルを開発すること。
  • 部分的依存効果から抽出したデータ駆動型のインサイトを活用し、特徴量空間のセグメンテーションと自動特徴量選択を実現すること。
  • 実世界の保険データセットで予測精度を維持しつつ、解釈可能なモデルを構築できる実用的でオープンソースのソリューション(Rパッケージ maidrr を通じて)を提供すること。

提案手法

  • ブラックボックスモデルから部分的依存効果を抽出し、予測に与える特徴量のグローバルな影響を理解する。
  • これらの部分的依存効果を活用して、意味のあるセグメントに特徴量の値をグループ化し、特徴量空間のデータ駆動型セグメンテーションを実現する。
  • セグメント化された特徴量およびその相互作用の重要性に基づき、自動特徴量選択を実施する。
  • セグメント化されたカテゴリカル特徴量と選択された相互作用項を用いて、解釈性を保証する透明な一般化線形モデル(GLM)を訓練する。
  • ブラックボックスモデルのアーキテクチャに関する仮定を一切必要としないため、モデルに依存しない。
  • Rパッケージ maidrr を用いて、規制環境での再現可能でアクセス可能な展開が可能な、完全なパイプラインを実装する。

実験結果

リサーチクエスチョン

  • RQ1データ駆動型のモデルに依存しない代替モデルは、勾配ブースティングマシン(GBM)に匹敵する高い予測性能を達成しつつ、解釈可能であると言えるか?
  • RQ2部分的依存効果を用いた特徴量空間のセグメンテーションと自動特徴量選択は、構造的テーブルデータにおいてどの程度有効であるか?
  • RQ3得られたGLM代替モデルは、標準的な線形モデルおよび木ベースの代替モデルと比較して、精度と解釈可能性の両面でどの程度優れているか?
  • RQ4提案手法は、多様な公開データセットを用いた実世界の保険損害発生頻度予測タスクに効果的に適用可能か?
  • RQ5代替モデルは、元のブラックボックスモデルの予測行動をどの程度正確に再現しつつ、規制適合のための透明性を確保できるか?

主な発見

  • maidrr GLM代替モデルは、6つの公開一般保険損害発生頻度データセットにおいて、勾配ブースティングマシン(GBM)の予測性能を非常に近く再現した。
  • maidrr代替モデルは、6つのデータセットすべてにおいて、標準線形モデルおよび木ベースの代替モデルを予測精度の面で上回った。
  • 部分的依存効果をガイドとしてデータ駆動型のセグメンテーションにより、関連する特徴量および相互作用を効果的に同定できた。
  • 得られたGLMは本質的に解釈可能であるため、規制が厳しい業界における監査にも適している。
  • 事前知識や手動の特徴量工学を一切必要とせず、自動的特徴量選択とセグメンテーションが可能であった。
  • Rパッケージ maidrr は、生産環境での解釈可能な代替モデルの展開に向けた再現可能でアクセス可能な実装を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。