Skip to main content
QUICK REVIEW

[論文レビュー] Sexism detection: The first corpus in Algerian dialect with a code-switching in Arabic/ French and English

Imane Guellil, Ahsan Adeel|arXiv (Cornell University)|Apr 3, 2021
Hate Speech and Cyberbullying Detection参考文献 55被引用数 7
ひとこと要約

本稿は、アラビア語、フランス語、英語のコードスイッチングを伴うアルジェリアー・ダリジャで、SNS上での女性へのセクシズムを標的とした、最初の公開可能な嫌がらせ表現コーパスを紹介する。5,000件のYouTubeコメントがアノテーターによってラベル付けされ、バランス型コーパス(1,798件)とアンバランス型コーパス(3,798件)が得られた。深層学習モデル、特にCNNは、アンバランス型コーパスでF1スコア86%を達成し、LSTMおよびBi-LSTMを上回った。

ABSTRACT

In this paper, an approach for hate speech detection against women in Arabic community on social media (e.g. Youtube) is proposed. In the literature, similar works have been presented for other languages such as English. However, to the best of our knowledge, not much work has been conducted in the Arabic language. A new hate speech corpus (Arabic\_fr\_en) is developed using three different annotators. For corpus validation, three different machine learning algorithms are used, including deep Convolutional Neural Network (CNN), long short-term memory (LSTM) network and Bi-directional LSTM (Bi-LSTM) network. Simulation results demonstrate the best performance of the CNN model, which achieved F1-score up to 86\% for the unbalanced corpus as compared to LSTM and Bi-LSTM.

研究の動機と目的

  • アラビア語、特にコードスイッチングを伴うアルジェリアー・ダリジャにおける嫌がらせ検出のためのアノテート済みデータセットの不足に対処すること。
  • YouTubeなどのSNSプラットフォームで女性を標的としたオンラインコメントの手動アノテーションコーパスを構築すること。
  • 低リソースでコードスイッチングが見られるアラビア語方言文脈におけるセクシズム検出のための複数の機械学習および深層学習モデルの評価を行うこと。
  • 特にジェンダーに基づく嫌がらせを対象とした、将来的な研究のベンチマークを確立すること。
  • 今後の翻訳表記法および多言語言語識別の統合を通じて、検出性能の向上を図ること。

提案手法

  • YouTubeの女性関連コメントから自動的にデータを収集し、初期段階で5,000件のコメントが得られた。
  • 3名のアルジェリアー・ダリジャ話者ネイティブが、標準化されたガイドラインに従って、嫌がらせあり/なしをラベル付けした。
  • アノテーター間合意が得られた3,798件のサブセットを用いて、アンバランス型コーパス(非嫌がらせ3,006件、嫌がらせ792件)を構築した。
  • 比較評価のため、合意セットからランダムに1,798件のバランス型サブセットを抽出した。
  • 複数の機械学習モデル(LSVC、GNB、LR、SGD、RF)および深層学習モデル(CNN、LSTM、Bi-LSTM)をコーパス上で訓練および評価した。
  • 深層学習モデルにおけるテキストシーケンスの表現に、Word2VecおよびFastText埋め込みを用いた。

実験結果

リサーチクエスチョン

  • RQ1アラビア語、フランス語、英語のコードスイッチングを伴うアルジェリアー・ダリジャにおけるセクシズム検出において、異なる機械学習および深層学習モデルの性能はいかがなっているか?
  • RQ2コーパスの選択(バランス型対アンバランス型)が、セクシズム検出のモデル性能にどのように影響するか?
  • RQ3CNN、LSTM、Bi-LSTMといった深層学習モデルは、この低リソースでコードスイッチングが見られるアラビア語方言コーパスにおいて、従来の機械学習モデルを上回る性能を示せるか?
  • RQ4翻訳表記法や言語識別といった前処理技術を用いることで、どのような改善が達成できるか?
  • RQ5手動アノテーションが施され、公開可能なコーパスは、今後のアラビア語嫌がらせ検出分野の研究をどのように支援できるか?

主な発見

  • CNNモデルはアンバランス型コーパスでF1スコア86%を達成し、LSTMおよびBi-LSTMモデルを上回った。
  • Bi-LSTMモデルはアンバランス型コーパスでF1スコア85%を達成し、コードスイッチドテキストにおけるシーケンスモデリングの強力な性能を示した。
  • CNNモデルはバランス型コーパスでF1スコア82%を達成し、クラス不均衡にもかかわらず高いロバスト性を示した。
  • LSVCモデルはアンバランス型コーパスでF1スコア80%を達成し、従来の分類器の中でも競争力のある性能を示した。
  • GNBおよびLRモデルは低い性能を示し、F1スコアはそれぞれ61%および72%であった。これは、本タスクに対して有効でない可能性を示唆した。
  • 本研究では、モデル精度の向上に向けた今後の鍵となる改善策として、翻訳表記法および多言語言語識別が特定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。