[論文レビュー] Examining Racial Bias in an Online Abuse Corpus with Structural Topic Modeling
本稿では、予測されたアフリカ系アメリカン英語(AAE)使用を共変量として組み込むことで、構造的トピックモデリング(STM)を用いてソーシャルメディアの嫌がらせデータセットにおける人種的バイアスを検出する。その結果、AAEと強く関連する1つのトピックが、嫌がらせのラベル付けと顕著に相関しており、嫌がらせ検出データセットにおける主要なバイアス要因を明らかにした。
We use structural topic modeling to examine racial bias in data collected to train models to detect hate speech and abusive language in social media posts. We augment the abusive language dataset by adding an additional feature indicating the predicted probability of the tweet being written in African-American English. We then use structural topic modeling to examine the content of the tweets and how the prevalence of different topics is related to both abusiveness annotation and dialect prediction. We find that certain topics are disproportionately racialized and considered abusive. We discuss how topic modeling may be a useful approach for identifying bias in annotated data.
研究の動機と目的
- 嫌がらせ検出に用いられるアノテート済みソーシャルメディアデータセットにおける人種的バイアスを調査すること。
- アフリカ系アメリカン英語(AAE)の使用が、嫌がらせとされる言語のアノテーションと相関するかどうかを検討すること。
- 構造的トピックモデリング(STM)を用いて、潜在的トピックと、それらの嫌がらせ度およびAAEとの関連を明らかにすること。
- AAEに関連する言語パターンが、自動嫌がらせ検出における誤検出(偽陽性)を引き起こすメカニズムを特定すること。
- トピックモデリングが、アノテート済みNLPデータセットに隠れたバイアスを暴露できることを示すこと。
提案手法
- 各ツイートがアフリカ系アメリカン英語(AAE)で書かれた確率を予測するための事前学習済み言語モデルを適用した。
- 嫌がらせアノテーションとAAE確率を共変量として用い、トピック出現頻度をモデル化する構造的トピックモデリング(STM)を実施した。
- URL、メンション、標点、数字、ストップワードを除去し、5件以上のツイートに出現する語のみを保持することで、ツイートを前処理した。
- 重複するツイートを除外し、希少語のみを含むドキュメントも除外した結果、最終的に75,023件のツイートが得られた。
- モデルの適合度と解釈可能性の両立を図るため、定量的診断と定性的な検討を基にK=30のトピック数を選定した。
- トピック頻度、AAE確率、嫌がらせアノテーションの関係をモデル化するため、estimateEffect関数を用いてトピック内比率を推定した。
実験結果
リサーチクエスチョン
- RQ1嫌がらせ言語データセットにおける特定のトピックが、アフリカ系アメリカン英語(AAE)使用と顕著に相関しているか?
- RQ2嫌がらせとアノテートされたツイートと通常とラベル付けされたツイートの間で、特定トピックの出現頻度に差があるか?
- RQ3嫌がらせツイートにおいて、AAE確率とトピック頻度の間に有意な相互作用があるか?
- RQ4構造的トピックモデリングは、アノテート済み嫌がらせ検出データセットに隠れたバイアスを明らかにできるか?
- RQ5AAEに関連するトピックが、嫌がらせアノテーションと強く相関しており、偽陽性の可能性を示唆するか?
主な発見
- トピック4は、AAE確率とトピック頻度の間に強く正の相関を示し、特に嫌がらせとラベル付けされたツイートで顕著である。AAE確率80%では、トピック頻度が50%を超えると予測された。
- トピック20は、嫌がらせツイートにおいてAAE確率とトピック頻度の間に負の相関を示しており、AAEの可能性が高くなるほどトピックの使用頻度が低下していることを示している。
- 大部分のトピック(30個中28個)は、トピック頻度とAAE確率との間に弱いか無視できる相関を示しており、大部分のコンテンツが人種的バイアスを含まないことを示唆している。
- トピック12および24は、アノテーションの種別にかかわらず、AAE確率とトピック頻度の間にほとんど平坦な関係を示しており、嫌がらせ度との関連性は最小限である。
- 結果として、AAEおよび嫌がらせアノテーションの両方と強く関連するトピックは4と20の2つに限られ、このデータセットにおける特定のバイアス要因を特定した。
- 本研究は、共変量を含むトピックモデリングが、特に人種および口語の観点から、アノテート済みテキストデータに隠れた構造的バイアスを明らかにできることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。