Skip to main content
QUICK REVIEW

[論文レビュー] Contextual Lexicon-Based Approach for Hate Speech and Offensive Language Detection.

Francielle Vargas, Fabiana Rodrigues de Góes|arXiv (Cornell University)|Apr 25, 2021
Hate Speech and Cyberbullying Detection参考文献 32被引用数 6
ひとこと要約

本稿では、文脈に依存するか否かに応じて分類された手動でアノテートされた攻撃的表現の語彙を活用し、ポルトガル語(ブラジル)における嫌がらせ発言および攻撃的言語の検出のための文脈的語彙ベースのアプローチを提案する。この手法は、ポルトガル語のデータセットにおいて最先端の性能を達成し、既存のベースラインを上回っている。

ABSTRACT

This paper provides a new approach for offensive language and hate speech detection on social media. Our approach incorporates an offensive lexicon composed of implicit and explicit offensive and swearing expressions annotated with binary classes: context-dependent and context-independent offensive. Due to the severity of the hate speech and offensive comments in Brazil, and the lack of research in Portuguese, Brazilian Portuguese is the language used to validate the proposed method. Nevertheless, our proposal may be applied to any other language or domain. Based on the obtained results, the proposed approach showed high-performance overcoming the current baselines for European and Brazilian Portuguese.

研究の動機と目的

  • ブラジルのソーシャルメディアにおける嫌がらせ発言や攻撃的コンテンツの増加という問題に対処するが、ポルトガル語における研究は依然として限られている。
  • ブラジルポルトガル語に特化した語彙ベースの検出システムを開発する。これは、この分野において低リソース言語である。
  • 文脈に依存するか否かの攻撃的表現の区別を活用して、検出性能を向上させる。
  • ポルトガル語にとどまらず、他の言語や分野へも応用可能な再利用可能なフレームワークを構築する。

提案手法

  • ブラジルポルトガル語における明示的および暗黙的攻撃的表現を含むカスタム攻撃的語彙を構築する。
  • 語彙の各エントリに対して、二値ラベル(文脈依存性または文脈非依存性)をアノテートする。
  • 文脈分類モデルに語彙を統合し、文の文脈内での語レベルの攻撃的潜在的要因を評価する。
  • 文における語の文脈的埋め込みを用いて、攻撃的語がその文脈で実際に攻撃的である可能性を判断する。
  • 実世界のブラジルポルトガル語のソーシャルメディアデータを用いて、モデルを訓練および評価する。
  • 語彙構築およびアノテーションパイプラインを再適用することで、他の言語へのアプローチの適応を図る。

実験結果

リサーチクエスチョン

  • RQ1既存の手法と比較して、文脈に配慮した語彙ベースのアプローチは、ブラジルポルトガル語における攻撃的言語検出性能を向上させることができるか?
  • RQ2文脈依存性と文脈非依存性の攻撃的表現の区別は、検出精度の向上にどの程度効果的か?
  • RQ3このアプローチは、ブラジルポルトガル語にとどまらず、他の言語や分野へどの程度一般化可能か?
  • RQ4文脈的情報を組み込むことで、暗黙的攻撃的言語の検出が著しく向上するか?

主な発見

  • 提案手法は、ブラジルポルトガル語における攻撃的言語および嫌がらせ発言検出タスクで最先端の性能を達成した。
  • モデルは既存のベースラインを上回り、明示的および暗黙的攻撃的言語検出の両方でF1スコアおよび精度が高かった。
  • 文脈依存性と文脈非依存性の攻撃的表現の区別が、検出精度の向上に寄与した。
  • この手法は強く一般化可能な可能性を示しており、類似した語彙ベースの適応が可能な他の言語への応用が期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。