[論文レビュー] Multilingual Cross-domain Perspectives on Online Hate Speech
本稿では、8つの多言語コーパスを対象として、自然言語処理(NLP)技術を用いた、ジャフジスト、過激主義、人種差別、性別差別のコンテンツを含む、多言語的・多分野的なオンラインいじめの分析を提示する。テキスト分類、キーワードおよび連語抽出、手動アノテーションを統合することで、言語や分野を越えて一貫した言語的特徴が明らかになった。本研究は、多言語環境におけるいじめの検出に向けたフレームワークを提供し、コンテンツモデレーションにおける実用的意義を持つ。
In this report, we present a study of eight corpora of online hate speech, by demonstrating the NLP techniques that we used to collect and analyze the jihadist, extremist, racist, and sexist content. Analysis of the multilingual corpora shows that the different contexts share certain characteristics in their hateful rhetoric. To expose the main features, we have focused on text classification, text profiling, keyword and collocation extraction, along with manual annotation and qualitative study.
研究の動機と目的
- ジャフジスト、過激主義、人種差別、性別差別などの多様な分野における多言語的オンラインいじめを分析すること。
- 異なる言語やいじめタイプ間で共通する言語的・修辞的特徴を同定すること。
- 多言語コーパスにおけるいじめの収集・分類・プロファイリングに、NLP技術を活用して開発・適用すること。
- いじめの修辞的特徴の体系的・言語的把握を通じて、コンテンツモデレーションおよび政策立案を支援すること。
提案手法
- 教師ありおよび半教師あり学習アプローチを用いて、8つの多言語コーパスにおけるいじめを分類するためのテキスト分類が実施された。
- スタイル的・構造的特徴を言語や分野を越えて分析するため、テキストプロファイリング技術が用いられた。
- キーワードおよび連語抽出により、いじめコンテンツにおける高頻度で文脈的に重要な表現が同定された。
- 自動化された結果の検証および微細な修辞的パターンの解明のため、手動アノテーションおよび定性的分析が実施された。
- 結果の強固さと解釈可能性を確保するため、計算的手法と言語学的手法の組み合わせが活用された。
- 再現可能性と実用的応用を重視した技術報告書形式を用いて、研究結果を文書化した。
実験結果
リサーチクエスチョン
- RQ1過激主義、人種差別、性別差別などの異なる分野における多言語的いじめにおいて、一貫して見られる言語的特徴は何か?
- RQ2言語や文化的文脈が異なる中で、いじめの修辞的パターンはどのように変化するか、あるいは類似しているか?
- RQ3テキスト分類や連語分析などのNLP技術が、多様なコーパスにおいていじめを検出・プロファイリングするのにどの程度有効か?
- RQ4手動アノテーションは、自動化されたいじめ検出システムの検証および最適化において、どのような役割を果たすか?
- RQ5現実世界のコンテンツモデレーションに応用可能な、分野横断的かつ多言語的いじめ検出を体系的にモデル化する方法は何か?
主な発見
- 多言語的いじめにおいて共通する修辞的特徴が同定された。具体的には、人間性の否定的表現、内集団/外集団の対立構造、および誇張表現の使用が含まれる。
- テキスト分類モデルは、多様な言語においても信頼性の高い性能を示した。これは、限定的なアノテーションデータでも、いじめのパターンが検出可能であることを示している。
- キーワードおよび連語分析により、特定のいじめタイプに関連する繰り返し現れる表現が明らかになった。例えば、過激主義的コンテンツでは宗教的・人種的差別表現が顕著に現れた。
- 手動アノテーションの結果、自動手法が核心的ないじめ特徴を捉えることができたが、文脈に敏感な表現については、さらに精緻化が必要であることが確認された。
- 分野横断的分析により、人種差別的・性別差別的・過激主義的いじめが、構造的・言語的特徴を共有していることが示され、共通の検出戦略の可能性が示された。
- 技術報告書のフレームワークにより、再現可能な分析が可能となり、今後の多言語的いじめ検出システムの基盤が構築された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。