[論文レビュー] A survey on datasets for fairness-aware machine learning
本調査は、公平性に配慮した機械学習で使用される表形式データセットの包括的概要を提供し、その構造、ベイジアンネットワークを用いたバイアスの関係、および公平性と性能のトレードオフを分析している。医療、金融、犯罪学などの分野にまたがる主要なデータセットが同定され、バイアスはしばしばデータそのものに起因しており、保護属性、クラスの不均衡、プロキシ特徴量といったデータセットの特性が公平性評価の結果に顕著に影響することが明らかになった。
As decision-making increasingly relies on Machine Learning (ML) and (big) data, the issue of fairness in data-driven Artificial Intelligence (AI) systems is receiving increasing attention from both research and industry. A large variety of fairness-aware machine learning solutions have been proposed which involve fairness-related interventions in the data, learning algorithms and/or model outputs. However, a vital part of proposing new approaches is evaluating them empirically on benchmark datasets that represent realistic and diverse settings. Therefore, in this paper, we overview real-world datasets used for fairness-aware machine learning. We focus on tabular data as the most common data representation for fairness-aware machine learning. We start our analysis by identifying relationships between the different attributes, particularly w.r.t. protected attributes and class attribute, using a Bayesian network. For a deeper understanding of bias in the datasets, we investigate the interesting relationships using exploratory analysis.
研究の動機と目的
- 公平性に配慮した機械学習研究で使用されている実世界の表形式データセットを体系的に収集・特徴記述すること。
- 保護属性、ラベル、その他の特徴量の間の関係をベイジアンネットワークを用いて分析し、隠れたバイアス構造を解明すること。
- データセット間での予測性能および公平性性能を評価し、モデルの結果に見られるばらつきを浮き彫りにすること。
- 現在のベンチマークデータセットにおける欠落要因を同定すること。具体的には、古くなったデータ、時間的・空間的文脈の欠如、現代の公平性概念の限られた表現。
- 現在の社会的・技術的課題を反映した、新しいオープンで多様なベンチマークデータセットの開発を提唱すること。
提案手法
- 学術論文の引用基準に基づき、少なくとも3つの公平性関連研究で使用されたデータセットを収集した。
- 保護属性と目的ラベルの間の条件付き依存関係をモデル化するため、ベイジアンネットワーク学習を適用した。
- ベイジアンネットワークの構造に基づく探索的データ分析を実施し、保護属性およびプロキシ属性を含む直接的・間接的な関係を同定した。
- 各データセットに対して分類モデルの定量的評価を実施し、公平性指標(例:デモグラフィックパラメータ、等しい機会)および予測性能(例:正解率、AUC)を用いた。
- 研究用途分野、保護属性、次元数、クラスの不均衡、公平性の課題ごとにデータセットを分類し、研究におけるデータセット選定を支援した。
- 公開リポジトリ(例:UCI、Kaggle)を活用し、非公開または再現不能なデータセットは除外することで、アクセシビリティと再現可能性を確保した。
実験結果
リサーチクエスチョン
- RQ1公平性に配慮した機械学習研究で最も一般的に使用されている実世界の表形式データセットは何か?
- RQ2これらのデータセットにおいて、保護属性は目的ラベルおよび他の特徴量とどのように関係しているのか。プロキシ属性は果たす役割は何か?
- RQ3データセットの特性(例:クラスの不均衡、次元数、保護属性の数)が公平性および予測性能に与える影響はどの程度か?
- RQ4公平性指標は異なるデータセット間でどのように変動し、アルゴリズムの評価にどのような含みを持たせるか?
- RQ5時間的または分布的公平性といった現代の公平性課題を反映していない、現在のベンチマークデータセットの主な制限は何か?
主な発見
- 1994年米国国勢調査から抽出された「Adult」データセットは、公平性に配慮した機械学習研究で最も広く使用されており、45,000件以上のインスタンスと14の特徴量を有する。
- ベイジアンネットワーク分析により、性別や人種といった保護属性が「婚姻状態」や「職業」、「出身国」などの複数の他の特徴量に条件付きで依存していることが判明し、強いプロキシ関係が存在することが示された。
- 再犯予測に使用されるCOMPASデータセットには顕著な人種バイアスが見られ、黒人被告は白人被告に比べて2倍近く、高リスクと誤分類される傾向にあった。
- クラスの不均衡は、調査されたデータセットの60%に見られ、ドイツ信用データセットでは良い評価と悪い評価の申請者との比率が2対1であった。この不均衡は公平性問題を悪化させる要因となる可能性がある。
- 公平性指標はデータセット間で著しくばらついており、デモグラフィックパラメータはドイツ信用データセットで0.12、ProPublicaのCOMPASデータセットで0.89を記録した。これは、公平性評価においてデータセットに応じた配慮が不可欠であることを示唆している。
- 調査されたデータセットの平均年齢は20年であり、最も古かったSUPPORTデータセットは48年前に収集されたもので、最新のKKBoxデータセットは7年前のものであった。これは、最新の状況を反映した現代的なベンチマークの開発が急務であることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。