Skip to main content
QUICK REVIEW

[論文レビュー] Nuanced Metrics for Measuring Unintended Bias with Real Data for Text Classification

Daniel Borkan, Lucas Dixon|arXiv (Cornell University)|Mar 11, 2019
Hate Speech and Cyberbullying Detection参考文献 12被引用数 4
ひとこと要約

本論文は、ROC-AUC、マン・ホイットニーU検定、等価ギャップに基づく、しきい値に依存しないメトリクスのセットを導入し、テキスト分類モデルにおける意図しないバイアスの洗練された評価を提供する。新たにクラウドソーシングされた約200万件のアノテート済みオンラインコメントのデータセットを用いて、著者らはバイアス低減技術が短いコメントにおけるバイアスを軽減できるが、長めのテキストでは残留バイアスが残ることがあることを示し、現在の公平性対策の限界を明らかにした。

ABSTRACT

Unintended bias in Machine Learning can manifest as systemic differences in performance for different demographic groups, potentially compounding existing challenges to fairness in society at large. In this paper, we introduce a suite of threshold-agnostic metrics that provide a nuanced view of this unintended bias, by considering the various ways that a classifier's score distribution can vary across designated groups. We also introduce a large new test set of online comments with crowd-sourced annotations for identity references. We use this to show how our metrics can be used to find new and potentially subtle unintended bias in existing public models.

研究の動機と目的

  • テキスト分類における意図しないバイアスを測る際のしきい値依存メトリクスの限界を是正すること。
  • 性的指向や人種などの異なるデモグラフィックグループにおける多様なバイアスの形を捉える包括的で洗練された評価フレームワークの構築すること。
  • 実際のバイアス評価に適した、アイデンティティ関連語を含む大規模かつ人間がアノテートしたオンラインコメントデータセットの作成と公開すること。
  • 実データと新しいメトリクスを用いて、パブリックなトキシシティ分類器におけるバイアス低減の有効性を評価すること。
  • 従来の公平性メトリクスでは見えにくくなる、隠れたまたは微細なバイアスを明らかにすること。

提案手法

  • ROC-AUC、マン・ホイットニーU検定、等価ギャップに基づく5つのしきい値に依存しないメトリクスを提案し、アイデンティティグループごとのモデルの公平性を評価する。
  • 合成テストセットと、アイデンティティ関連語を含む約200万件のコメントの新しい大規模人間アノテートデータセットを用いて、モデルのパフォーマンスを評価する。
  • バイアス低減ありのモデル(TOXICITY@6)となしのモデル(TOXICITY@1)の2つのパブリックなPerspective APIモデルを比較して、バイアスプロファイルを分析する。
  • 特定のアイデンティティグループにおける有毒・非有毒コメントのスコア分布を可視化し、バイアスのパターンを明確にする。
  • サブグループAUC、BPSN AUC、ネガティブAEGを用いて、デモグラフィックサブグループ間でのモデル行動の差を検出する。
  • 短いコメントと長いコメントにおけるモデル行動の比較を通じて、バイアス低減の影響を分析する。特にアイデンティティ用語に注目する。

実験結果

リサーチクエスチョン

  • RQ1しきい値に依存しないメトリクスは、しきい値依存メトリクスと比較して、どのような種類の意図しないバイアスを明らかにするか?
  • RQ2トキシシティ分類器におけるバイアス低減は、さまざまなデモグラフィックアイデンティティグループにわたって、意図しないバイアスをどの程度軽減するか?
  • RQ3既知の低減技術が施されたにもかかわらず、現実世界のテキスト分類モデルにどのようなバイアスのパターンが残っているか?
  • RQ4コメントの長さは、トキシシティ分類モデルにおける意図しないバイアスの現れ方にどのように影響するか?
  • RQ5大規模かつアイデンティティがアノテートされたデータセットは、テキスト分類器における微細で洗練されたバイアスの検出をどのように向上させるか?

主な発見

  • バイアス低減ありのモデル(TOXICITY@6)は、短いコメントにおいて特に『homosexual_gay_or_lesbian』というアイデンティティグループに対して、サブグループAUCおよびBPSN AUCで顕著な改善を示した。
  • 短いコメントでは、元のモデル(TOXICITY@1)がアイデンティティ関連語について、非有毒と有毒のスコア分布の重なりが著しく大きく、高いバイアスを示していた。
  • 低減措置が施された後でも、特に『black』や『asian』といったグループでは、アイデンティティグループごとのメトリクスの分散が高く、訓練データに非有毒データが追加されていないため、依然としてバイアスが顕著に見られた。
  • メトリクスの分析から、バイアス低減は訓練データの不均衡が著しかった短いコメントでは効果的であったが、長いコメントでは効果が薄れた。
  • 新規データセットのおかげで、従来は見えにくかったバイアスが検出可能となり、低減策がコメントの長さやアイデンティティグループにわたって完全に一般化されていないことが明らかになった。
  • 可視化結果から、低減措置によりアイデンティティ用語の非有毒スコアが左(低いスコア)にシフトし、特に短いコメントでは有毒スコアとの重なりが減少していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。