[論文レビュー] Demographics Should Not Be the Reason of Toxicity: Mitigating Discrimination in Text Classifications with Instance Weighting
この論文は、非差別的分布から差別の的分布への選択バイアスをモデル化することで、テキスト分類における意図しない人種的・性的指向的バイアスを緩和するモデルに依存しないデバイアス化フレームワークを提案する。事前定義された人種的・性的指向用語に基づくインスタンス重み付けを用いることで、追加のデータやアノテーションを必要とせず、不偏なモデル学習を回復させ、3つのベンチマークデータセットにおいて一般化性能を維持したまま、公平性の乖離を顕著に低減する。
With the recent proliferation of the use of text classifications, researchers have found that there are certain unintended biases in text classification datasets. For example, texts containing some demographic identity-terms (e.g., "gay", "black") are more likely to be abusive in existing abusive language detection datasets. As a result, models trained with these datasets may consider sentences like "She makes me happy to be gay" as abusive simply because of the word "gay." In this paper, we formalize the unintended biases in text classification datasets as a kind of selection bias from the non-discrimination distribution to the discrimination distribution. Based on this formalization, we further propose a model-agnostic debiasing training framework by recovering the non-discrimination distribution using instance weighting, which does not require any extra resources or annotations apart from a pre-defined set of demographic identity-terms. Experiments demonstrate that our method can effectively alleviate the impacts of the unintended biases without significantly hurting models' generalization ability.
研究の動機と目的
- 「ゲイ」や「ブラック」といったアイデンティティ用語が毒性と不均衡に関連付けられる、テキスト分類データセットにおける意図しない人種的バイアスを是正すること。
- バイアスを非差別的分布から差別的分布への選択バイアスとして形式化すること。
- 追加のデータ収集やアノテーションを除き、事前に定義されたアイデンティティ用語リストのみを用いるデバイアス化手法を開発すること。
- 公平性の乖離を顕著に低減しつつ、モデルの一般化性能を維持すること。
- NLPにおけるバイアス是正のためのデータ拡張や補完の実用的でスケーラブルな代替手段を提供すること。
提案手法
- 意図しないバイアスを、アイデンティティ用語に基づき、非差別的分布からのサンプルが選択的に毒性とラベル付けされる選択バイアスとして形式化する。
- バイアスがかかるデータセット内の各サンプルが、そのアイデンティティコンテンツに依存する確率で非差別的分布から抽出されたものであると仮定する。
- 観測されたバイアスデータとアイデンティティ用語リストのみを用いて、非差別的分布を学習できるように、インスタンス重みを導出する。
- モデル学習中に重みを適用し、不偏な損失を最小化することで、データ分布を変更せずにモデルをデバイアス化する。
- バックプロパゲーション中に交差エントロピー損失を重み付けし、異なるアーキテクチャに一般化可能に適用できるようにする。
- 3つのデータセット(Jigsaw Toxicity、Toxicity Comments、および第3のデータセット)で手法を検証し、ベースラインおよびデータ補完ベースラインと比較する。
実験結果
リサーチクエスチョン
- RQ1追加のラベル付きデータやアノテーションを必要とせず、テキスト分類における人種的バイアスを是正できるか?
- RQ2インスタンス重み付けは、バイアスのかかっているデータセットから非差別的分布を回復させるのにどの程度有効か?
- RQ3提案手法は、公平性の乖離を低減しつつも、モデルの一般化性能を維持できるか?
- RQ4データ補完や拡張と比較して、公平性と性能の両面でどのように差がつくか?
- RQ5この手法は、さまざまなNLPタスクやモデルアーキテクチャに一般化して適用可能か?
主な発見
- Jigsaw Toxicityデータセットでは、提案手法のWeight法がIPTTS AUC 0.852を達成し、ベースライン(0.835)を上回り、データ補完の結果(0.853)と同等の性能を示した。
- Weight法は全体の偽陽性率(FPR)を0.035まで低下させ、ベースラインの0.068と比較して、公平性と正確性の向上を示した。
- 「ゲイ」「ホモセクシュアル」「レズビアン」を含む文について、Weightモデルは全体のFPRからの乖離(ΔFPR)をほぼゼロにまで低減し、顕著な公平性の向上を達成した。
- 追加のデータ収集やアノテーションを必要とせず、データ補完と同等または優れた公平性指標(FPEDおよびFNED)を達成した。
- Toxicity Commentsデータセットでは、Weight法がIPTTS AUCおよびFPEDでベースラインを上回り、追加データなしでデータ補完と同等の性能を示した。
- 一般化性能は維持されており、Orig. AUCスコアがベースラインおよびデータ補完と同等であったため、全体的なモデル能力に顕著な低下は認められなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。