[論文レビュー] Social Biases in NLP Models as Barriers for Persons with Disabilities
この論文は、NLPモデルが、特に毒性評価やセンチメント分類において、障害を有する人々に対して測定可能な社会的バイアスを示していることを示している。推薦される障害関連用語でさえ、不適切または否定的であると不適切に特定される傾向がある。研究では、モデルの埋め込みと下流分類器が、精神的疾患、難聴、失明などに言及する際に有害な社会的ステレオタイプを内蔵していることが明らかになった。これは、包摂的設計と障害コミュニティの関与によるバイアス軽減の必要性を強調する。
Building equitable and inclusive NLP technologies demands consideration of whether and how social attitudes are represented in ML models. In particular, representations encoded in models often inadvertently perpetuate undesirable social biases from the data on which they are trained. In this paper, we present evidence of such undesirable biases towards mentions of disability in two different English language models: toxicity prediction and sentiment analysis. Next, we demonstrate that the neural embeddings that are the critical first step in most NLP pipelines similarly contain undesirable biases towards mentions of disability. We end by highlighting topical biases in the discourse about disability which may contribute to the observed model biases; for instance, gun violence, homelessness, and drug addiction are over-represented in texts discussing mental illness.
研究の動機と目的
- NLPモデルが障害を有する人々に対して社会的バイアスを内蔵し、それを継続的に発信しているかどうかを調査すること。
- 推奨される表現と非推奨の表現を含む、障害に関する異なる言語的表現がモデル出力に与える影響を検討すること。
- 精神的疾患、ホームレス、薬物乱用に関する議論における、データレベルのバイアスがモデル行動に与える影響を分析すること。
- オンラインプラットフォームや自動化システムにおける障害を有する人々に及ぼすモデルバイアスの社会的・技術的影響を浮き彫りにすること。
- 障害コミュニティの参加を含む包摂的モデル開発を提唱し、NLPにおける ableist バイアスを是正すること。
提案手法
- 摂動ベースの評価:文における代名詞を障害関連表現に置き換えて、モデルスコアの変化を測定する。
- 2つの事前学習済みモデル(毒性予測用の Perspective API とセンチメント分類器)を用いて、モデル出力の定量的分析を行う。
- 障害関連用語の意味的表現におけるバイアスを検出するため、ニューラル単語埋め込みを分析する。
- 公的 Reddit コーパスを分析し、精神的疾患および関連疾患に関する議論におけるトピックバイアスを同定する。
- 障害擁護団体のガイドラインに基づき、障害関連表現を「推奨される」または「非推奨の」に分類する。
- 障害の種別に応じて、推奨される語と非推奨の語の平均スコア差を比較し、バイアスの強度を評価する。
実験結果
リサーチクエスチョン
- RQ1NLPモデルは、毒性評価やセンチメント分類において、障害の言及に対して測定可能なバイアスを示しているか?
- RQ2推奨される表現と非推奨の表現が、モデルの予測にどのように影響するか?
- RQ3精神的疾患、ホームレス、薬物乱用に関する議論におけるデータレベルのバイアスが、モデルバイアスにどの程度寄与しているか?
- RQ4単語埋め込みにおけるバイアスは、障害を有する人々に対する社会的態度をどのように反映・強化しているか?
- RQ5これらのモデルバイアスが、オンラインコミュニケーションや自動化システムにおける障害を有する人々に及える現実世界の影響は何か?
主な発見
- 障害を有する人々を言及する文の毒性スコアは、中立的または非障害関連の参照よりも顕著に高く、'a person with mental illness' は Perspective API で 0.62 のスコアを記録した。
- 推奨される表現である 'a deaf person' は、中立的参照の 'a tall person'(0.03)よりも高い毒性スコア(0.44)を示し、システムバイアスの兆候が明らかになった。
- 障害関連表現のセンチメントスコアは、中立的参照よりも一貫して否定的であり、'a blind person' の平均スコアは -0.39 であった。
- ニューラル単語埋め込みでは、測定可能なバイアスが確認され、障害関連用語が埋め込み空間の意味的に否定的またはステグマ化された領域に集約されていた。
- 公的コーパスにおける精神的疾患に関する議論は、銃器暴力、ホームレス、薬物乱用に関連する文脈に過剰に含まれており、これがモデルバイアスの要因である可能性がある。
- バイアスの強度は障害の種別によって異なり、精神的疾患や身体的障害では、非障害者参照よりも強い否定的関連が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。