[論文レビュー] Fairness in Machine Learning: A Survey
本調査は機械学習における公正性の入門的概要を提供し、アプローチを前処理、インプロセシング、後処理に整理し、指標、手法、ツールキット、および未解決の課題を詳述する。
As Machine Learning technologies become increasingly used in contexts that affect citizens, companies as well as researchers need to be confident that their application of these methods will not have unexpected social implications, such as bias towards gender, ethnicity, and/or people with disabilities. There is significant literature on approaches to mitigate bias and promote fairness, yet the area is complex and hard to penetrate for newcomers to the domain. This article seeks to provide an overview of the different schools of thought and approaches to mitigating (social) biases and increase fairness in the Machine Learning literature. It organises approaches into the widely accepted framework of pre-processing, in-processing, and post-processing methods, subcategorizing into a further 11 method areas. Although much of the literature emphasizes binary classification, a discussion of fairness in regression, recommender systems, unsupervised learning, and natural language processing is also provided along with a selection of currently available open source libraries. The article concludes by summarising open challenges articulated as four dilemmas for fairness research.
研究の動機と目的
- 読者に機械学習における公正性の主要概念と歴史を紹介する。
- 公正性指標とそのトレードオフを要約・標準化する。
- 公正なMLアプローチの二次元分類(前処理、インプロセシング、後処理)を提供し、非二値タスクへ拡張する。
- 法的および社会的説明責任を含む、実務上の考慮事項と一般的に用いられるツールキットを強調する。
- 将来の公正性研究を導く四つのジレンマと未解決課題を特定する。
提案手法
- 公正性手法を前処理、インプロセシング、後処理に統一的介入フレームワーク内で分類する。
- 共通の記法で、グループ、個人、反事実を含む広範な公正性指標を整理・対比する。
- 独立性、分離、充足の抽象的公正基準と、それらの不可能性結果を論じる。
- さまざまなML段階におけるブラインド、因果法、サンプリング/サブグループ分析といったメソッド系をレビューし、それぞれの適用性を検討する。
- データ代理指標、保護変数、潜在的な法的・解釈可能性への影響など、実務的な考慮事項を概説する。
- 利用可能なオープンソースライブラリを要約し、現在の研究方向を四つの将来のジレンマに対応づけて示す。
実験結果
リサーチクエスチョン
- RQ1機械学習における公正性を達成する主な方法論的カテゴリは何であり、それらはデータおよびモデルの段階(前処理、インプロセシング、後処理)とどのように関連するか?
- RQ2二値および非二値タスクにおいて、さまざまな公正性指標をどのように定義・解釈し、精度とどのようにトレードオフするか?
- RQ3因果、ブラインド、サンプリングアプローチの公正な結果達成における力学と限界は何か?
- RQ4現実の設定で公正な機械学習を展開する際に存在する実務的ツールと未解決課題は何か?
主な発見
- 公正性の普遍的な定義は存在せず、複数の指標が異なる概念を捉え、統計的平等、同等のオッズ、キャリブレーションなど、固有のトレードオフを有する。
- 前処理・インプロセシング・後処理は柔軟な介入点を提供するが、普遍的に比較可能ではなく、それぞれ固有の解釈性と法的影響を持つ。
- 文献はグループ公正性と個別公正性の間の緊張を強調しており、特定条件下で互換性のない目的を示す不可能性結果が多く存在する。
- 因果、代理指標、グラフベースの手法は偏りと代理指標を特定するのに役立つが、十分な背景情報を必要とし、計算コストが高い場合がある。
- 公正MLを支えるオープンソースライブラリは拡大しているが、データ品質、代理変数、データの動的シフトなどの実務的課題により採用はまだ難しい。
- 研究者は将来の研究を導く四つのジレンマに焦点を当て、アクセス性・説明責任・社会的影響を中心に据えている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。