[論文レビュー] Automated Ableism: An Exploration of Explicit Disability Biases in Sentiment and Toxicity Analysis Models
本稿では、感情分析およびトキシシティ分析モデルにおける明示的な障害差別的バイアスを検出するための、Sentiment(感情)におけるバイアス特定テスト(BITS)コーパスを紹介する。ソーシャルメディアデータを用いたパラメータ変動感受性分析により、6つのAIaaSモデルにおいて障害関連用語に対して統計的に有意な否定的センチメントスコアが観察された。これは、広く使われているNLPツールにおいて、自動化された障害差別的バイアスが広範に存在することを示している。
We analyze sentiment analysis and toxicity detection models to detect the presence of explicit bias against people with disability (PWD). We employ the bias identification framework of Perturbation Sensitivity Analysis to examine conversations related to PWD on social media platforms, specifically Twitter and Reddit, in order to gain insight into how disability bias is disseminated in real-world social settings. We then create the extit{Bias Identification Test in Sentiment} (BITS) corpus to quantify explicit disability bias in any sentiment analysis and toxicity detection models. Our study utilizes BITS to uncover significant biases in four open AIaaS (AI as a Service) sentiment analysis tools, namely TextBlob, VADER, Google Cloud Natural Language API, DistilBERT and two toxicity detection models, namely two versions of Toxic-BERT. Our findings indicate that all of these models exhibit statistically significant explicit bias against PWD.
研究の動機と目的
- 広く使われているAIaaSのセンチメントおよびトキシシティ分析モデルに、明示的な障害差別的バイアスが存在するかを調査すること。
- センチメント分析システムにおける障害差別的バイアスを定量化するための、モデルに依存しないテストフレームワークを開発すること。
- TwitterおよびRedditのリアルワールドのソーシャルメディア会話の分析を通じて、障害関連言語がNLPモデルによってどのように誤分類されるかを理解すること。
- 障害関連用語が単独で存在するだけで、文脈にかかわらず否定的センチメントスコアが発生することを示すこと。
- オンライン空間におけるNLPツールの自動バイアスが、障害を有する人々にどのように悪影響を及えるかを啓発すること。
提案手法
- 中立的な文のテンプレートに障害関連用語を導入した際のセンチメントスコアの変化を評価するため、パラメータ変動感受性分析(PSA)を採用する。
- 障害を有する人々(PWD)、特定の障害を有する人々(PWD:SD)、非障害を有する人々(PWoD)の用語を用いたテンプレートベースのパラメータ変動を用いて、BITSコーパスを構築する。
- 4つのセンチメント分析モデル(TextBlob、VADER、Google Cloud Natural Language API、DistilBERT)および2つのトキシシティ検出モデル(Toxic-BERT(オリジナル版およびアンバイアス版))を用いて評価を行う。
- バイアスを定量化するための3つの主要な指標を計算する:ScoreSense(センチメントスコアの変化)、LabelDistance(センチメントシフトの大きさ)、ScoreDev(パラメータ変動スコアの標準偏差)。
- 観察されたセンチメントシフトの統計的有意性を評価するためt検定を適用し、p値を用いてバイアスの深刻さを示す。
- 今後のNLPモデルにおける障害差別的バイアスに関する研究を可能にするために、BITSコーパスを公開する。

実験結果
リサーチクエスチョン
- RQ1広く使われているAIaaSのセンチメントおよびトキシシティ分析モデルは、障害を有する人々に対して明示的なバイアスを示すか?
- RQ2中立的な文に障害関連用語が導入された際、センチメントスコアはどのように変化するか。また、その変化は統計的に有意か?
- RQ3異なるAIaaSモデルは、文脈的意味ではなく、意味的バイアスのため、障害関連言語をどれほど誤分類するか?
- RQ4TextBlobのような標準化された、モデルに依存しないテストは、センチメントおよびトキシシティモデルにおける障害差別的バイアスを信頼性高く検出および定量化できるか?
- RQ5このようなバイアスは、オンラインコンテンツモデレーションおよびセンチメント分析システムにおいて、どのような現実世界の影響を及ぼすか?
主な発見
- 評価対象の6つのAIaaSモデル(TextBlob、VADER、Google Cloud Natural Language API、DistilBERT、およびToxic-BERTの2バージョン)すべてが、統計的に有意な明示的なバイアスを示した。
- TextBlobは文「My neighbour is a blind person」に対して-0.50の否定的センチメントスコアを割り当て、強い障害差別的バイアスを示した。
- VADERは「PWD:C」用語に対して-0.25**の顕著なセンチメントシフトを示し、-0.05**の「PWD:SD」用語に対しても同様の傾向を示した。これは、体系的な否定的スコアリングを示している。
- 両方のToxic-BERTモデルのLabelDistance値は0.8を超えており、障害関連用語の導入によって、感情極性が著しくシフトしていることを示している。
- Toxic-BERTモデルのScoreDev値はそれぞれ0.05および0.09であり、スコアの整合性が低く、さらに不安定さとバイアスの兆候を示している。
- 本研究は、障害関連用語が単独で存在するだけで、文脈にかかわらず否定的センチメントまたはトキシシティ分類が行われることを確認した。これは、障害を有する人々の誤解を招く有害な表現を生じさせることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。