[論文レビュー] Mitigating Discrimination in Insurance with Wasserstein Barycenters
本稿では、年齢や人種、性別などの感受性属性に関連する歴史的データバイアスに起因する保険料の差別的 pricingを是正するため、Wassersteinバーチャルセンターを用いる手法を提案する。この手法は、単なる平均スケーリングに依存するのではなく、分布の違いを保ちながら、異なる人種的グループ間でのリスク予測を調整することで、差別の的でない保険料を実現する。実際の自動車保険データを用いた実証的検証により、特にデモグラフィックパラティーション(demographic parity)の違反が顕著に減少した。
The insurance industry is heavily reliant on predictions of risks based on characteristics of potential customers. Although the use of said models is common, researchers have long pointed out that such practices perpetuate discrimination based on sensitive features such as gender or race. Given that such discrimination can often be attributed to historical data biases, an elimination or at least mitigation is desirable. With the shift from more traditional models to machine-learning based predictions, calls for greater mitigation have grown anew, as simply excluding sensitive variables in the pricing process can be shown to be ineffective. In this article, we first investigate why predictions are a necessity within the industry and why correcting biases is not as straightforward as simply identifying a sensitive variable. We then propose to ease the biases through the use of Wasserstein barycenters instead of simple scaling. To demonstrate the effects and effectiveness of the approach we employ it on real data and discuss its implications.
研究の動機と目的
- 年齢、人種、性別などの感受性属性と相関する歴史的データバイアスに起因する、継続的な保険料の不公平な設定という問題に取り組むこと。
- 機械学習ベースのリスクモデルにおける公平性を達成するための、単純な変数除外や平均ベースのスケーリングの限界を克服すること。
- リスクスコアの分布全体を考慮することで、単に平均値のみに依存するのではなく、グループ間で公平に予測値を調整する手法を開発すること。
- 最適輸送理論を基盤とし、解釈可能で実証的に有効な、保険科学分野における公平性のための理論的裏付けのあるアプローチを提供すること。
- Wassersteinバーチャルセンターが、実世界の保険データセットにおいてモデル性能を維持したまま、デモグラフィックパラティーションの違反を低減できることを実証すること。
提案手法
- 最適輸送理論を用いて、感受性グループに跨るリスク予測分布のWassersteinバーチャルセンターを計算し、公平な予測値の調整を可能にする。
- グループ固有の予測分布から Wasserstein 距離が最小となるような基準分布(バーチャルセンター)を構築し、歪みを最小限に抑える。
- 単純なスケーリング(例:予測値に係数を乗算する)に代えて、各グループのリスク分布の形状と広がりを尊重する分布に依存する変換を採用する。
- バーチャルセンターは凸最適化フレームワークを用いて計算され、公平な予測値の効率的かつ安定的な推定を可能にする。
- 年齢を感受性属性として用い、実際の自動車保険データに適用し、GLM、GBM、RF モデルの各々で性能を比較した。
- 公平性はデモグラフィックパラティーションを指標として評価され、本手法が予測精度を損なわず、差別の的格差を低減することが示された。

実験結果
リサーチクエスチョン
- RQ1従来のスケーリング手法と比較して、Wassersteinバーチャルセンターは保険料のデモグラフィックパラティーション違反を効果的に低減できるか?
- RQ2最適輸送による分布調整は、平均ベースのスケーリングと比較して、公平性と予測性能をどのように維持・向上させるか?
- RQ3感受性属性がモデル化に直接使用されない状況において、Wassersteinバーチャルセンターは間接的差別をどの程度是正できるか?
- RQ4異なる機械学習モデル(GLM、GBM、RF)において、本手法はどの程度解釈可能で、かつロバストであるか?
- RQ5バーチャルセンターに基づく調整は、若年運転者と高年齢運転者の間でリスク予測格差にどのような影響を与えるか?
主な発見
- 65歳以上の高年齢運転者において、バーチャルセンター手法により、予測された事故確率の格差が、ベースラインの5.27%から5%未満の初期リスク状態で4.71%にまで低下し、公平性が著しく向上した。
- 初期リスクが20%の場合、ベースラインモデルは高年齢運転者に対して21.26%の予測値を出力したが、バーチャルセンター手法により18.85%に低下し、格差が縮小された。
- 30歳未塔の若年運転者において、初期リスクが20%の場合、ベースラインモデルは14.84%の予測値を出力したが、バーチャルセンター手法により12.54%に低下し、過剰なペナルティの是正が有効に実現された。
- 特にリスクが高めのセグメントにおいて、格差が顕著に現れる状況で、単純なスケーリング手法に比べ、バーチャルセンター手法がデモグラフィックパラティーション違反の低減において優れた性能を示した。
- GLM、GBM、RFの各モデルにおいて、本手法は予測精度を維持しており、実際の保険環境におけるロバスト性と実用的妥当性を示した。
- 一致した予測値の可視化結果から、特にリスク分布の末尾部において、平均ベースのスケーリングに比べ、バーチャルセンター手法がグループの分布をより適切に一致させていることが確認された。
![Figure 2: Distributions of $m(\boldsymbol{x},s={\color[rgb]{0,0.62890625,0.54296875}\definecolor[named]{pgfstrokecolor}{rgb}{0,0.62890625,0.54296875}\text{{A}}})$ and $m(\boldsymbol{x},s={\color[rgb]{0.94921875,0.6796875,0}\definecolor[named]{pgfstrokecolor}{rgb}{0.94921875,0.6796875,0}\text{{B}}})$](https://ar5iv.labs.arxiv.org/html/2306.12912/assets/figs/gender/unnamed-chunk-3-1.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。