[論文レビュー] Are Chess Discussions Racist? An Adversarial Hate Speech Data Set
この論文は、チェスの用語に含まれる人種的用語のため、市販の嫌がらせスパム分類器が無害なチェス討論を誤って嫌がらせと分類してしまうかどうかを調査している。YouTubeのチェスチャンネルから収集した681,995件のコメントを用いたデータセットを用いて、分類器によって誤って分類された人間による検証済みの非嫌がらせコメントが1,000件同定された。これはドメインの耐性の欠如という深刻な問題を示しており、NLPモデルにおける体系的な色の多義性の存在を明らかにしている。
On June 28, 2020, while presenting a chess podcast on Grandmaster Hikaru Nakamura, Antonio Radić's YouTube handle got blocked because it contained "harmful and dangerous" content. YouTube did not give further specific reason, and the channel got reinstated within 24 hours. However, Radić speculated that given the current political situation, a referral to "black against white", albeit in the context of chess, earned him this temporary ban. In this paper, via a substantial corpus of 681,995 comments, on 8,818 YouTube videos hosted by five highly popular chess-focused YouTube channels, we ask the following research question: \emph{how robust are off-the-shelf hate-speech classifiers to out-of-domain adversarial examples?} We release a data set of 1,000 annotated comments where existing hate speech classifiers misclassified benign chess discussions as hate speech. We conclude with an intriguing analogy result on racial bias with our findings pointing out to the broader challenge of color polysemy.
研究の動機と目的
- 人種的用語のおかげで、市販の嫌がらせ分類器が無害なチェス関連の議論を誤って嫌がらせと分類するかどうかを調査すること。
- 特にチェス解説のようなドメイン外のコンテンツに適用した際の、市販の嫌がらせ分類器の耐性を検討すること。
- 特に'白'と'黒'の多義性が、嫌がらせ検出における誤検出を引き起こす役割を分析すること。
- 異なるテクストドメインにおける類似性テストを通じて、単語埋め込みのバイアスの広範な影響を検討すること。
- 将来の研究のための、1,000件の誤分類されたチェスコメントを収集したデータセットを公開すること。
提案手法
- YouTube APIを用いて、5つの人気のあるチェスチャンネルの8,818本のYouTube動画から681,995件のコメントを収集した。
- 2つの事前学習済み嫌がらせ分類器を適用した:1つはTwitterデータで微調整されたもの($\mathcal{M}_{\mathit{twitter}}$)、もう1つは白人至上主義フォーラムのデータセットで学習されたもの($\mathcal{M}_{\mathit{stormfront}}$)。
- 少なくとも1つの分類器によって嫌がらせと分類されたコメントをランダムに1,000件抽出し、人間によるアノテーションで真のラベルを特定した。
- チェス、フォックス・ニュース、CNNのコメントデータセットからの単語埋め込みに対して、類似性テスト(例:'黒' : '奴隷' :: '白' : ?)を実施し、意味的バイアスを評価した。
- 人間によるアノテーション済みのゴールスタンダードを用いて、誤検出率を測定し、ドメイン間での分類器のパフォーマンスを評価した。
- 誤検出のパターンを特定するため、'攻撃'、'脅し'、'取り込み'、色の用語といった言語的トリガーを分析した。
実験結果
リサーチクエスチョン
- RQ1市販の嫌がらせ分類器は、どれほど無害なチェス討論を誤って嫌がらせと分類してしまうのか?
- RQ2嫌がらせ分類器の性能は、特にチェス関連のコンテンツに適用した場合、ドメインによってどのように変化するのか?
- RQ3特に色の用語や戦闘比喩といった言語的特徴は、嫌がらせ検出における誤検出をどのように引き起こすのか?
- RQ4異なるドメイン(例:チェス対ニュース)からの単語埋め込みは、類似性推論において人種的ステレオタイプをどのように反映または歪曲するのか?
- RQ5チェス用語における'白'と'黒'の文脈が、NLPモデルにおける人種的バイアスにどれほど寄与しているのか?
主な発見
- 分類器によって嫌がらせと分類されたコメントの82.4%が実際には無害であったため、チェス討論における誤検出率は82.4%に達した。
- 白人至上主義フォーラムのデータセットで学習されたBERTベースの分類器($\mathcal{M}_{\mathit{stormfront}}$)は、Twitterデータで学習されたモデル($\mathcal{M}_{\mathit{twitter}}$)よりもわずかに低い誤検出率を示し、人種的嫌がらせ分類においてより良いドメイン適合性を示した。
- 極端な嫌がらせコンテンツで学習されたにもかかわらず、$\mathcal{M}_{\mathit{stormfront}}$は依然としてチェスコメントの82.4%を誤って嫌がらせと分類しており、ドメイン外への一般化能力の欠如を示している。
- 類似性テスト '黒 : 奴隷 :: 白 : ?' において、チェスデータセットでは'奴隷'が予測されたが、フォックス・ニュースとCNNのデータセットでは'奴隷主'が予測された。これは、チェスの文脈が埋め込みにおいて人種的権力関係を正常化していることを示している。
- '白'、'黒'、'攻撃'、'脅し'、'取り込み'といった用語が、誤検出の主なトリガーであった。これは、語義の多義性が誤分類の根本的原因であることを示している。
- たとえ文脈的に中立的なドメイン、たとえば'白'と'黒'が純粋に象徴的であるチェスのような分野においても、NLPモデルは多義性とバイアスの強い事前学習データのおかげで、それらの用語を人種的権力関係と関連付ける傾向があることを本研究は示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。