Skip to main content
QUICK REVIEW

[論文レビュー] Can Active Learning Preemptively Mitigate Fairness Issues?

Frédéric Branchaud-Charron, Parmida Atighehchian|arXiv (Cornell University)|Apr 14, 2021
Machine Learning and Data Classification参考文献 23被引用数 5
ひとこと要約

本稿では、不確実性に基づくアドティブラーニング(特にBALD)が、保護群全体におけるエピステミック不確実性を低減することで、機械学習モデルの公平性を能動的に改善できるかを調査している。BALDはi.i.d.サンプリングと比較して予測の同等性と精度を顕著に向上させ、感度属性の事前知識がなくても勾配反転を組み合わせることでさらに公平性が向上することを示している。

ABSTRACT

Dataset bias is one of the prevailing causes of unfairness in machine learning. Addressing fairness at the data collection and dataset preparation stages therefore becomes an essential part of training fairer algorithms. In particular, active learning (AL) algorithms show promise for the task by drawing importance to the most informative training samples. However, the effect and interaction between existing AL algorithms and algorithmic fairness remain under-explored. In this paper, we study whether models trained with uncertainty-based AL heuristics such as BALD are fairer in their decisions with respect to a protected class than those trained with identically independently distributed (i.i.d.) sampling. We found a significant improvement on predictive parity when using BALD, while also improving accuracy compared to i.i.d. sampling. We also explore the interaction of algorithmic fairness methods such as gradient reversal (GRAD) and BALD. We found that, while addressing different fairness issues, their interaction further improves the results on most benchmarks and metrics we explored.

研究の動機と目的

  • アドティブラーニングにBALDを用いることで、機械学習モデルにおける公平性の問題を能動的に緩和できるかを調査すること。
  • 感度属性の知識がなくても、BALDが大多数と少数派のグループ間の予測の同等性のギャップを縮小するかを評価すること。
  • BALDと公平性に配慮した手法(例:勾配反転(GRAD))の相互作用が、公平性指標の改善に与える影響を検討すること。
  • BALDの性能を均一サンプリングおよび公平性に配慮したベースラインと比較し、公平性と精度の両面で評価すること。

提案手法

  • BALD(ベイジアンアドティブラーニングのヒューリスティック)を用い、モデルの予測と事後分布重みの相互情報量に基づいて、最も情報量の多いサンプルを選択する。
  • BALDの相互情報量計算における扱いにくい期待値を近似するために、モンテカルロドロップアウトを採用する。
  • 勾配反転(GRAD)を公平性正則化手法として採用し、モデルが誤った感度属性に依存するのを防ぐ。
  • VGG-16モデルをラベル付きデータ上で20エポック分訓練し、各50サンプルのバッチごとに再訓練を行う。
  • バランスの取れたホールドアウトテストセットを用いて、精度と予測の同等性を評価する。
  • 3つの異なるランダムシードを用いて実験を繰り返し、標準偏差を計算し、結果の妥当性を確認する。

実験結果

リサーチクエスチョン

  • RQ1BALDを用いたアドティブラーニングは、保護群間のモデル予測における公平性の格差を低減できるか?
  • RQ2感度属性が不明な状態でも、BALDは均一サンプリングと比較して予測の同等性を向上させるか?
  • RQ3BALDと勾配反転を組み合わせることで、予測の同等性や精度といった公平性指標にどのような影響を与えるか?
  • RQ4BALDはグループ間のエピステミック不確実性の差を低減させ、より公平なモデル行動に寄与するか?

主な発見

  • BALDは少数派グループで10%のラベリング条件下で、予測の同等性が3.56 ± 1.70に達し、均一サンプリング(10.73 ± 2.70)を著しく上回った。
  • BALDは少数派グループの精度を91.66 ± 0.36%まで向上させたが、均一サンプリングでは87.23 ± 1.77%にとどまった。
  • BALDに勾配反転(λ=0.5)を組み合わせることで、予測の同等性は2.16 ± 1.13にまで低下し、BALD単体やGRADを適用した均一サンプリングよりも優れた性能を示した。
  • BALDとGRADの組み合わせは、感度属性の予測の同等性を1.27 ± 0.88にまで低下させたのに対し、均一サンプリングにGRADを適用した場合(λ=1)は5.50 ± 1.51であった。
  • BALDは時間経過とともにグループ間のエピステミック不確実性の絶対差を低減させたが、GRADを適用した均一サンプリングでは、不確実性の差がほぼ2倍に増大した。
  • BALDにGRADを組み合わせた手法は、ラベル付きデータセットの完全なアクセスを必要とする最先端の公平性手法REPAIRと同等の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。