[論文レビュー] HateBR: A Large Expert Annotated Corpus of Brazilian Instagram Comments for Offensive Language and Hate Speech Detection
本稿では、7,000件のポルトガル語のブラジルインスタグラムコメントから構成される、攻撃的言語および嫌がらせ発言検出のための、最初の大規模な専門家によるアノテーション付きコーパス「HateBR」を紹介する。3層にわたるアノテーションスキーム(攻撃的/非攻撃的、攻撃性の度合い、9つの嫌がらせ発言カテゴリ)を適用し、ベースラインモデルで85%のF1スコアを達成し、既存のポルトガル語ベースラインを上回る。
Due to the severity of the social media offensive and hateful comments in Brazil, and the lack of research in Portuguese, this paper provides the first large-scale expert annotated corpus of Brazilian Instagram comments for hate speech and offensive language detection. The HateBR corpus was collected from the comment section of Brazilian politicians' accounts on Instagram and manually annotated by specialists, reaching a high inter-annotator agreement. The corpus consists of 7,000 documents annotated according to three different layers: a binary classification (offensive versus non-offensive comments), offensiveness-level classification (highly, moderately, and slightly offensive), and nine hate speech groups (xenophobia, racism, homophobia, sexism, religious intolerance, partyism, apology for the dictatorship, antisemitism, and fatphobia). We also implemented baseline experiments for offensive language and hate speech detection and compared them with a literature baseline. Results show that the baseline experiments on our corpus outperform the current state-of-the-art for the Portuguese language.
研究の動機と目的
- ブラジルポルトガル語における攻撃的言語および嫌がらせ発言検出のための、大規模かつ専門家によるアノテーション付きデータセットの不足を解消すること。
- 嫌がらせ発言および攻撃的コンテンツの文脈的・実用的ニュアンスを捉えることのできる、多層的なアノテーションスキームの構築。
- 自然言語処理モデルの学習および評価を目的とした、高品質でバランスの取れた、アノテーター間合意度の高いコーパスの提供。
- 特に政治的対立が強い文脈を含むブラジルのソーシャルメディアにおける、攻撃的言語および嫌がらせ発言検出のベンチマークの確立。
- 構造化されたアノテーションが、現在の最先端の結果を上回る優れたモデル性能をもたらすことを実証すること。
提案手法
- HateBRコーパスは、政治的・社会的対立が強いとされるブラジルの政治家アカウントのインスタグラムコメント欄から収集された。
- 3層のアノテーションスキームを適用した:(1) 二値分類(攻撃的 vs. 非攻撃的)、(2) 攻撃性度分類(軽度、中程度、重度)、(3) 9つのカテゴリに分類される嫌がらせ発言グループ分類。
- 言語学者、嫌がらせ発言専門家、自然言語処理研究者からなる専門チームが、厳密なガイドラインとトレーニングに従ってアノテーションを実施し、一貫性とバイアスの低減を図った。
- アノテーター間合意度は測定され、高い水準にあり、アノテーションスキームの信頼性が裏付けられた。
- ベースラインモデルは、ユニグラムおよびTF-IDF特徴量を用い、ナイーブベイズ、SVM、MLP、ロジスティック回帰を用いて、攻撃的言語および嫌がらせ発言検出タスクに適用した。
- 嫌がらせ発言検出タスクにおけるクラス不均衡は、過学習を防ぎ、モデルの汎化性能を向上させるためにアンダーサンプリングにより対処した。
実験結果
リサーチクエスチョン
- RQ1攻撃的言語および嫌がらせ発言検出のための大規模かつ専門家によるアノテーション付きコーパスを、この分野でリソースが乏しい言語であるポルトガル語(ブラジル)において、効果的に構築できるか?
- RQ2攻撃性度や特定の嫌がらせ発言カテゴリを含む多層的アノテーションスキームが、自然言語処理タスクにおけるデータセットの質と有用性を向上させるか?
- RQ3アノテーションの質(アノテーター間合意度で測定)と、嫌がらせ発言検出における下流のモデル性能の間には、どの程度の相関があるか?
- RQ4このコーパスで学習されたベースラインモデルは、既存のポルトガル語における攻撃的言語および嫌がらせ発言検出の最先端モデルを上回る性能を示せるか?
- RQ5HateBRコーパスは、サイズ、バランス、アノテーション品質、パフォーマンスベンチマークの観点から、既存のポルトガル語コーパスと比較してどの程度優れているか?
主な発見
- HateBRコーパスは7,000件のインスタグラムコメントから構成され、うち3,500件が攻撃的、残り3,500件が非攻撃的とラベル付けされており、クラス分布がバランスされている。
- コーパスは高いアノテーター間合意度スコアを達成し、提案された3層アノテーションスキームの堅牢性と一貫性が裏付けられた。
- 攻撃的言語検出のベースラインモデルはF1スコア85%を達成し、既存の最先端モデルを顕著に上回った。
- 嫌がらせ発言検出においては、最良のベースラインモデルがF1スコア78%を達成し、クラス不均衡の影響にもかかわらず優れた性能を示した。
- HateBRコーパスは、サイズ、アノテーション品質、モデルパフォーマンスの点で、既存のポルトガル語コーパスを上回り、言語分野における新たなベンチマークを確立した。
- 結果から、構造化されたアノテーションと専門家によるアノテーションが、シンプルなベースラインモデルであっても優れたモデル性能をもたらすことが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。