Skip to main content
QUICK REVIEW

[論文レビュー] SOLD: Sinhala Offensive Language Dataset

Tharindu Ranasinghe, Isuri Anuradha|arXiv (Cornell University)|Dec 1, 2022
Hate Speech and Cyberbullying Detection被引用数 5
ひとこと要約

この論文は、文およびトークンレベルのラベルを付与した10,000件のツイートを含む、スリランカの僧伽羅語(Sinhala)向けの最初の大規模で手動でアノテートされた攻撃的言語データセットSOLDを紹介する。これにより、モデルの解釈可能性が向上する。また、145,000件を超えるツイートを含む半教師付き拡張版であるSemiSOLDを提示し、限られたリソースしかない僧伽羅語においても、攻撃的言語検出の性能が向上する。

ABSTRACT

The widespread of offensive content online, such as hate speech and cyber-bullying, is a global phenomenon. This has sparked interest in the artificial intelligence (AI) and natural language processing (NLP) communities, motivating the development of various systems trained to detect potentially harmful content automatically. These systems require annotated datasets to train the machine learning (ML) models. However, with a few notable exceptions, most datasets on this topic have dealt with English and a few other high-resource languages. As a result, the research in offensive language identification has been limited to these languages. This paper addresses this gap by tackling offensive language identification in Sinhala, a low-resource Indo-Aryan language spoken by over 17 million people in Sri Lanka. We introduce the Sinhala Offensive Language Dataset (SOLD) and present multiple experiments on this dataset. SOLD is a manually annotated dataset containing 10,000 posts from Twitter annotated as offensive and not offensive at both sentence-level and token-level, improving the explainability of the ML models. SOLD is the first large publicly available offensive language dataset compiled for Sinhala. We also introduce SemiSOLD, a larger dataset containing more than 145,000 Sinhala tweets, annotated following a semi-supervised approach.

研究の動機と目的

  • 低リソース言語、特に僧伽羅語における攻撃的言語検出のためのアノテート済みデータセットの不足に対処すること。
  • NLPおよびAI研究を支援するため、高品質で手動でキュレートされた僧伽羅語の攻撃的言語検出用データセットを構築すること。
  • 僧伽羅語における攻撃的コンテンツのトークンレベルのアノテーションを可能にすることで、モデルの解釈可能性を向上させること。
  • 半教師付きアプローチを用いて、SOLDを拡張し、145,000件を超えるツイートを含むSemiSOLDを構築することで、より広範なモデル学習を可能にすること。
  • スリランカで1,700万人以上が使用する僧伽羅語向けに、強固な攻撃的言語検出システムの開発を可能にすること。

提案手法

  • 文およびトークンレベルで、10,000件の僧伽羅語ツイートを手動でアノテートし、攻撃的でない内容と区別する。
  • 生の僧伽羅語ツイートから、半教師付き学習パイプラインを適用して、より大きなデータセットであるSemiSOLDを生成する。
  • 人間によるアノテーションデータを用いて、半教師付きラベル付けプロセスをガイドおよび検証する。
  • 標準的なNLPおよび機械学習手法を用いて、SOLDおよびSemiSOLD上で攻撃的言語検出モデルの学習および評価を行う。
  • 分類とモデル出力の解釈可能性を両立させるための二段階アノテーションスキームを設計する。
  • SOLDおよびSemiSOLD上で複数のモデルを評価し、低リソース環境下での性能と耐性を評価する。

実験結果

リサーチクエスチョン

  • RQ1手動でアノテートされた僧伽羅語の攻撃的言語データセットは、攻撃的コンテンツ検出のためのNLPモデルの性能向上にどの程度効果的か?
  • RQ2半教師付き学習は、僧伽羅語のような低リソース言語における攻撃的言語検出のスケーラビリティをどの程度向上させられるか?
  • RQ3トークンレベルのアノテーションは、僧伽羅語における攻撃的言語検出モデルの解釈可能性および正確性を向上させられるか?
  • RQ4SOLDで学習させたモデルとSemiSOLDで学習させたモデルのF1スコアおよび耐性の観点での性能差は何か?
  • RQ5データセットのサイズとアノテーション品質は、低リソース言語環境下でのモデル一般化にどのような影響を与えるか?

主な発見

  • SOLDは、文およびトークンレベルのラベルを備えた、最初の公開可能な大規模で手動でアノテートされた僧伽羅語の攻撃的言語データセットであり、10,000件のツイートを含む。
  • 半教師付き拡張版であるSemiSOLDは、145,000件を超える僧伽羅語のツイートを含み、攻撃的言語検出のためのトレーニングデータが大幅に拡張された。
  • 二段階アノテーション(文およびトークン)により、特定の攻撃的語句や表現を特定することで、モデルの解釈性が向上する。
  • このデータセットにより、僧伽羅語という低リソース言語であるにもかかわらず、競争力のある性能を達成する機械学習モデルの学習が可能になった。
  • 本研究では、半教師付きデータ拡張が、アノテーション品質を維持したまま、攻撃的言語データセットのスケーリングに効果的に寄与できることを示した。
  • SOLDおよびSemiSOLDの公開により、将来的な低リソースNLP分野の研究、特に僧伽羅語における嫌がらせやヘイトスピーチの検出分野の研究が促進される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。