Skip to main content
QUICK REVIEW

[論文レビュー] Fairkit, Fairkit, on the Wall, Who's the Fairest of Them All? Supporting Data Scientists in Training Fair Models

Brittany Johnson, Jesse Bartola|arXiv (Cornell University)|Dec 17, 2020
Ethics and Social Impacts of AI参考文献 45被引用数 7
ひとこと要約

Fairkit-learn は、複数のアルゴリズム、ハイパーパramータ、データの並べ替えを網羅的に評価することで、公平性と精度のバランスを取る機械学習モデルの探索と選定を支援するオープンソースのツールキットです。ユーザースタディーでは、scikit-learn や IBM AI Fairness 360 を使用した場合と比較して、学生が最大 67% 公平性が向上し、10% の精度向上を達成するモデルを生成できました。

ABSTRACT

Modern software relies heavily on data and machine learning, and affects decisions that shape our world. Unfortunately, recent studies have shown that because of biases in data, software systems frequently inject bias into their decisions, from producing better closed caption transcriptions of men's voices than of women's voices to overcharging people of color for financial loans. To address bias in machine learning, data scientists need tools that help them understand the trade-offs between model quality and fairness in their specific data domains. Toward that end, we present fairkit-learn, a toolkit for helping data scientists reason about and understand fairness. Fairkit-learn works with state-of-the-art machine learning tools and uses the same interfaces to ease adoption. It can evaluate thousands of models produced by multiple machine learning algorithms, hyperparameters, and data permutations, and compute and visualize a small Pareto-optimal set of models that describe the optimal trade-offs between fairness and quality. We evaluate fairkit-learn via a user study with 54 students, showing that students using fairkit-learn produce models that provide a better balance between fairness and quality than students using scikit-learn and IBM AI Fairness 360 toolkits. With fairkit-learn, users can select models that are up to 67% more fair and 10% more accurate than the models they are likely to train with scikit-learn.

研究の動機と目的

  • 実世界の機械学習応用において、公平性と品質のトレードオフを理解するのを支援するツールの不足に取り組むこと。
  • 普遍的な公平性の定義がない多様なデータドメインにおいて、データサイエンティストが公平性とパフォーマンスを最適化するモデルの選定を支援すること。
  • 既存の ML ワークフロー(例:scikit-learn)と統合可能で、Pareto 最適なモデルセットの可視化をサポートする、アクセス可能で相互運用性のあるツールキットを提供すること。
  • 偏ったデータにおいて公平性の結果を誤って表現する傾向があるため、精度のみを公平性の代理指標とする依存を減らすこと。
  • 複数の公平性定義とメトリクスをサポートする統一インターフェースを通じて、データサイエンティストがモデルの公平性を監査・デバッグ・考察できるようにすること。

提案手法

  • Fairkit-learn は、複数の学習アルゴリズム(例:ロジスティック回帰、ランダムフォレスト、敵対的デバイアス)を用いて、さまざまなハイパーパramータとデータの並べ替えに対して数千のモデルをトレーニングおよび評価します。
  • 各設定に対して公平性メトリクス(例:デモグラフィックパラティーション、等しい機会)とモデル品質メトリクス(例:正解率、F1スコア)を計算します。
  • 公平性と品質の間で最良のトレードオフを示す Pareto 最適なモデルセットを特定し、ユーザーの理解を支援するための可視化を行います。
  • 標準的な scikit-learn スタイルのインターフェースを採用することで、既存の ML パipラインやワークフローへのシームレスな統合を実現します。
  • 複数の公平性定義をサポートし、ドメイン固有の公平性基準とパフォーマンスメトリクスに基づいてモデルを比較できるようにします。
  • インタラクティブな可視化を通じて、公平性と品質のトレードオフの全体像を探索可能にすることで、公平性とパフォーマンスの両方の目標を満たすモデルの選定を支援します。

実験結果

リサーチクエスチョン

  • RQ1専用のツールが利用できない状況では、データサイエンティストはどのように公平性を評価しており、どのようなメトリクスを標準的に使用するのか?
  • RQ2scikit-learn や IBM AI Fairness 360 といった標準ツールと比較して、Fairkit-learn のようなツールキットが、モデル選択における公平性と精度のバランスをどの程度改善できるのか?
  • RQ3公平性に配慮した評価を用いたモデル設定の体系的探索は、標準的手順による選択と比較して、顕著に公平性が高く、かつ精度の高いモデルを導くことができるのか?
  • RQ4Fairkit-learn は、公平性とモデル品質の最良のトレードオフを示す Pareto 最適なモデルをユーザーが特定するのをどの程度効果的に支援できるのか?
  • RQ5公平性と品質のトレードオフの可視化は、データサイエンティストの意思決定をどの程度支援するのか?

主な発見

  • 54名の学生を対象とした制御されたユーザースタディーにおいて、Fairkit-learn を使用した学生は、scikit-learn を使用した場合と比較して、最大 67% 公平性が向上したモデルを生成しました。
  • Fairkit-learn を使用した学生は、scikit-learn を使用した場合と比較して、最大 10% の精度向上を達成し、公平性とパフォーマンスのバランスが向上していることが示されました。
  • Fairkit-learn を使用したユーザーは、モデル選択の段階で公平性メトリクスをより積極的に考慮する傾向が強く、精度を公平性の代理指標とする依存を減らすことができました。
  • このツールキットは、多様なデータセットにおいて、公平性と品質の最良のトレードオフを示す少数の実行可能で意味のある Pareto 最適なモデルセットを効果的に同定できました。
  • Fairkit-learn は、scikit-learn や IBM AI Fairness 360 を上回り、ユーザーがより良い公平性・品質のバランスを達成するのを支援するという点で、実世界のモデル選択シナリオにおける有効性を示しました。
  • 本研究では、専用の公平性ツールがなければ、データサイエンティストは品質メトリクス(例:正解率)に依存しがちであり、公平性の問題を無視する傾向があることが明らかになりました。これにより、統合的な公平性支援の必要性が強調されました。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。