Skip to main content
QUICK REVIEW

[論文レビュー] SWSR: A Chinese Dataset and Lexicon for Online Sexism Detection

Aiqi Jiang, Xiaohan Yang|arXiv (Cornell University)|Aug 6, 2021
Hate Speech and Cyberbullying Detection被引用数 13
ひとこと要約

本稿では、Sina Weiboから収集されたマルチスケールラベル(いわゆる差別的/差別的でない、分類、標的タイプ)を備えた、中国語のオンラインセクシュアリズム検出のための最初の中国語データセットおよびSexHateLex語彙(SWSR)を紹介する。本研究では最先端のモデルをこのデータセットで評価し、中国語NLPにおける嫌がらせ発言検出のベンチマークを確立するとともに、微細で隠れたセクシュアリズムを検出するうえでの主な課題を浮き彫りにした。

ABSTRACT

Online sexism has become an increasing concern in social media platforms as it has affected the healthy development of the Internet and can have negative effects in society. While research in the sexism detection domain is growing, most of this research focuses on English as the language and on Twitter as the platform. Our objective here is to broaden the scope of this research by considering the Chinese language on Sina Weibo. We propose the first Chinese sexism dataset -- Sina Weibo Sexism Review (SWSR) dataset --, as well as a large Chinese lexicon SexHateLex made of abusive and gender-related terms. We introduce our data collection and annotation process, and provide an exploratory analysis of the dataset characteristics to validate its quality and to show how sexism is manifested in Chinese. The SWSR dataset provides labels at different levels of granularity including (i) sexism or non-sexism, (ii) sexism category and (iii) target type, which can be exploited, among others, for building computational methods to identify and investigate finer-grained gender-related abusive language. We conduct experiments for the three sexism classification tasks making use of state-of-the-art machine learning models. Our results show competitive performance, providing a benchmark for sexism detection in the Chinese language, as well as an error analysis highlighting open challenges needing more research in Chinese NLP. The SWSR dataset and SexHateLex lexicon are publicly available.

研究の動機と目的

  • オンラインセクシュアリズムを検出するためのアノテート済み中国語リソースの不足、特に明示的ミゾジニズムを超えた分野の課題に対処すること。
  • Weibo投稿およびユーザーのコメントをカバーする包括的な中国語セクシュアリズムデータセット(SWSR)の開発。文脈的およびメタデータ情報を含む。
  • 有害語およびジェンダー関連用語の大型スケールでドメイン特化された語彙(SexHateLex)の構築。
  • 分類のバイナリ分類を超えた、セクシュアリズムの種類と標的の細分化分析を可能にすること。
  • 最先端のモデルを用いた中国語におけるセクシュアリズム検出のベンチマークを提供し、将来的なマルチリンガルおよびクロスリンガル研究を促進すること。

提案手法

  • SWSRデータセットはSina Weiboから収集され、オリジナルのWeibo投稿、ユーザーのコメント、および匿名化されたユーザーのメタデータ(性別、所在地、フォロワー数)を含む。
  • マルチレベルのアノテーションスキームを適用:(i) セクシュアリズム的/非セクシュアリズム的、(ii) セクシュアリズムの分類(例:敵対的、好意的)、(iii) 標的タイプ(例:女性、ジェンダー規範)。
  • 有害語およびジェンダーステレオタイプ語から成る中国語語彙であるSexHateLexを、言語的および文脈的特徴を含めて編集した。
  • 詳細なガイドラインに従って訓練済みのアノテーターがデータセットをアノテートし、品質を保証するためのアノテーター間一貫性を測定した。
  • 変換器ベースのアーキテクチャを含むベースラインモデルをSWSRデータセット上で微調整し、3つの分類タスクについて評価した。
  • 誤差分析を実施し、中国語のテキストにおける内面的・間接的なセクシュアリズムの検出における継続的な課題を特定した。

実験結果

リサーチクエスチョン

  • RQ1中国語のソーシャルメディア、特にSina Weiboにおいて、オンラインセクシュアリズムは言語的パターンや標的タイプの観点からどのように現れるのか?
  • RQ2最先端のNLPモデルは、マルチスケールラベルを備えた中国語のテキストで、セクシュアリズム的コンテンツをどの程度正確に検出できるのか?
  • RQ3中国語における内面的または好意的な形態のセクシュアリズムを検出するうえでの主な課題は何か。また、それらはモデルのパフォーマンスにどのように影響するのか?
  • RQ4ユーザーのメタデータ(例:性別、所在地)は、中国語オンラインディス course におけるセクシュアリズム的コンテンツ生成とどの程度相関しているのか?
  • RQ5ドメイン特化語彙(SexHateLex)の統合は、リソースが限られた状況下でセクシュアリズム検出モデルのパフォーマンスを向上させることができるか?

主な発見

  • SWSRデータセットには1,500件のアノテート済みWeibo投稿と1,500件のコメントが含まれており、3段階のマルチグレインラベル(セクシュアリズム的/非セクシュアリズム的、分類、標的タイプ)が付与されている。
  • SexHateLex語彙には1,200語以上の中国語語彙が含まれており、攻撃的言語の的を絞った検出を支援する。
  • ベースラインモデルは、F1スコア0.78(バイナリ分類)、0.72(分類分類)、0.69(標的タイプ分類)を達成し、今後の研究のためのベンチマークを確立した。
  • 誤差分析から、好意的・間接的な形態のセクシュアリズムを検出するうえで継続的な困難が明らかになった。特に文脈が曖昧または文化的に繊細な場合に顕著であった。
  • データセットから、セクシュアリズム的コンテンツはしばしば文化的に特化した表現やジェンダーのステレオタイプに埋め込まれており、文脈に配慮したモデルが必要であることが示された。
  • ユーザーのメタデータ分析から、女性ユーザーがセクシュアリズム的発言の標的としてより多く選ばれていることが示され、地域的差異も観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。