Skip to main content
QUICK REVIEW

[論文レビュー] Multilingual Twitter Corpus and Baselines for Evaluating Demographic Bias in Hate Speech Recognition

Xiaolei Huang, Linzi Xing|arXiv (Cornell University)|Feb 24, 2020
Hate Speech and Cyberbullying Detection参考文献 48被引用数 44
ひとこと要約

この論文は、英語、イタリア語、ポーランド語、ポルトガル語、スペイン語にまたがる著者レベルの人口統計属性(年齢、国、性別、人種)を含む多言語Twitterヘイトスピーチコーパスを提示し、ベースライン分類器の性能と公平性を評価し、言語と人口統計の変動を分析します。

ABSTRACT

Existing research on fairness evaluation of document classification models mainly uses synthetic monolingual data without ground truth for author demographic attributes. In this work, we assemble and publish a multilingual Twitter corpus for the task of hate speech detection with inferred four author demographic factors: age, country, gender and race/ethnicity. The corpus covers five languages: English, Italian, Polish, Portuguese and Spanish. We evaluate the inferred demographic labels with a crowdsourcing platform, Figure Eight. To examine factors that can cause biases, we take an empirical analysis of demographic predictability on the English corpus. We measure the performance of four popular document classifiers and evaluate the fairness and bias of the baseline classifiers on the author-level demographic attributes.

研究の動機と目的

  • 公正性評価を可能にするため、著者レベルの人口統計属性で注釈付けされた多言語ヘイトスピーチコーパスを作成する。
  • 公開プロフィールから推定された人口統計属性(年齢、国、性別、人種)を取り入れて、ヘイトスピーチ検出の偏りを研究する。
  • 言語を横断するベースライン分類結果を提供し、グループベースの指標を用いて公平性を分析する。

提案手法

  • 5言語データセットのヘイトスピーチラベルを統合し、二項化して統一的な多言語コーパスを形成する。
  • プロフィール画像(Face++)と位置情報(Google Maps)から人口統計属性を推定し、属性推定のためにツイート内容を除外する。
  • プロフィールのサンプルを対象にクラウドソーシングで人口統計属性推定の精度を評価する。
  • 言語横断でヘイトスピーチ検出を対象に4つのベースライン分類器(ロジスティック回帰、CNN、RNN、BERT)を評価する。
  • 人口統計グループ間の真陽性/偽陽性/真陰性/偽陰性率の差を用いて公平性を評価する。

実験結果

リサーチクエスチョン

  • RQ1著者レベルの人口統計属性は、複数言語でのヘイトスピーチ検出性能にどのように影響するか?
  • RQ2多言語ヘイトスピーチコーパスで人口統計グループを対象に評価した際、一般的な文書分類器の公平性プロファイルはどのようになるか?
  • RQ3テキストからの推定とプロファイル由来特徴からの推定はどれくらい人口統計属性を予測できるか、そしてそれが公平性分析にとって何を意味するか?

主な発見

  • ベースライン分類器は言語ごとに性能が異なる。ニューラルモデル(CNN, RNN)は一般にロジスティック回帰を上回る一方、BERTはドメイン一般化の問題で一部の言語で劣る。
  • 年齢と性別は複数の言語でより顕著な公平性差を示し、ポーランド語とイタリア語では年齢/性別に対する偏りが強い。一方、国籍と人種に関連する偏りは言語によって異なる。
  • 英語データは属性間で最も偏りが小さい傾向がある一方、ポーランド語/イタリア語データは複数のモデルで年齢と性別に対する偏见が高い。
  • 言語とモデルを横断した全体的な分類性能と公平性バイアスの間に強く一貫した相関はない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。