Skip to main content
QUICK REVIEW

[論文レビュー] AlexU-AIC at Arabic Hate Speech 2022: Contrast to Classify

Ahmad Shapiro, Ayman Khalafallah|arXiv (Cornell University)|Jul 18, 2022
Hate Speech and Cyberbullying Detection被引用数 9
ひとこと要約

この論文は、OSACT5 2022共有課題で提供された小規模で不均衡なデータセットを対象として、アラビア語の嫌がらせ発言検出を改善するための対照的学習とマルチタスク学習のアプローチを提示する。対照的事前学習、マルチタスク微調整、モデルアンサンブルを組み合わせることで、本手法はサブタスクAで0.841、サブタスクBで0.817、サブタスクCで0.476のマクロF1スコアを達成し、ベースラインモデルを著しく上回った。

ABSTRACT

Online presence on social media platforms such as Facebook and Twitter has become a daily habit for internet users. Despite the vast amount of services the platforms offer for their users, users suffer from cyber-bullying, which further leads to mental abuse and may escalate to cause physical harm to individuals or targeted groups. In this paper, we present our submission to the Arabic Hate Speech 2022 Shared Task Workshop (OSACT5 2022) using the associated Arabic Twitter dataset. The shared task consists of 3 sub-tasks, sub-task A focuses on detecting whether the tweet is offensive or not. Then, For offensive Tweets, sub-task B focuses on detecting whether the tweet is hate speech or not. Finally, For hate speech Tweets, sub-task C focuses on detecting the fine-grained type of hate speech among six different classes. Transformer models proved their efficiency in classification tasks, but with the problem of over-fitting when fine-tuned on a small or an imbalanced dataset. We overcome this limitation by investigating multiple training paradigms such as Contrastive learning and Multi-task learning along with Classification fine-tuning and an ensemble of our top 5 performers. Our proposed solution achieved 0.841, 0.817, and 0.476 macro F1-average in sub-tasks A, B, and C respectively.

研究の動機と目的

  • アラビア語のソーシャルメディア、特にTwitterにおける攻撃的言語および嫌がらせ発言の検出の課題に対処すること。特に、データセットが小規模で不均衡であるという点に注目する。
  • 限られたアラビア語データセット上で微調整されたトランスフォーマー・モデルの過学習を克服するため、対照的学習とマルチタスク学習のパラダイムを検討すること。
  • 3段階のサブタスク、すなわち攻撃的言語検出、嫌がらせ発言の特定、および詳細な嫌がらせ発言タイプ分類の分類性能を向上させること。
  • 共有課題の異なるサブタスクにおいて、対照的学習、マルチタスク学習、アンサンブル手法の有効性を比較すること。

提案手法

  • 著者は、限られたラベル付きデータ上で表現学習を向上させるために、アラビア語向けに事前学習されたトランスフォーマー・モデルであるAraBERTを、対照的学習を用いて微調整する。
  • サブタスクA(攻撃的言語検出)とサブタスクB(嫌がらせ発言検出)を同時に学習するマルチタスク学習を適用し、表現を共有することで一般化性能を向上させる。
  • サブタスクC(詳細な嫌がらせ発言分類)については、嫌がらせ発言のツイートのサブセット上で別個のマルチタスクモデルを訓練し、共有エンコーダー特徴を活用する。
  • サブタスクAでは上位5つのモデルのアンサンブルを用いて性能を向上させ、サブタスクBおよびCには専用のマルチタスクモデルを適用する。
  • 対照的学習の目的関数は、類似したツイート表現が埋め込み空間で近づき、異なるものは遠ざかるようにする対照的損失関数を実装している。
  • モデルは、データスパムの低減を図るための慎重なデータ分割とクラスのバランス調整戦略を用いて、8.8kのラベル付きツイートデータセット上で訓練された。

実験結果

リサーチクエスチョン

  • RQ1小規模で不均衡なデータセットにおいて、対照的学習はアラビア語の攻撃的言語および嫌がらせ発言検出の表現学習を改善できるか?
  • RQ2関連するサブタスク(攻撃的言語検出と嫌がらせ発言検出)間でマルチタスク学習を適用することで、単一タスクの微調整よりも性能が向上するか?
  • RQ3低リソースのアラビア語NLPの文脈において、アンサンブル手法は個々のモデルの性能と比べてどのように異なるか?
  • RQ43つのサブタスク全体のF1スコア向上において、対照的事前学習とエンドツーエンドの微調整の相対的寄与度は何か?
  • RQ5詳細な嫌がらせ発言カテゴリの共同学習は、下流の嫌がらせ発言検出タスク全体の分類性能を向上させられるか?

主な発見

  • 上位5つのモデルのアンサンブルは、サブタスクA(攻撃的言語検出)でマクロF1スコア0.841を達成し、ベースラインの0.394を著しく上回った。
  • マルチタスク学習モデルは、サブタスクB(嫌がらせ発言検出)でマクロF1スコア0.817を達成し、ベースラインの0.472を上回った。
  • サブタスクC(詳細な嫌がらせ発言分類)では、マルチタスクモデルがマクロF1スコア0.476を達成し、ベースラインの0.135から著しく向上した。
  • 対照的学習とマルチタスク学習は、小規模で不均衡なアラビア語データセットにおける過学習の緩和に有効であることが判明した。
  • アブレーションスタディの結果、対照的事前学習とマルチタスク微調整を組み合わせたアプローチが、すべてのサブタスクで最良の結果をもたらした。
  • アンサンブルアプローチはサブタスクAにおいて最も効果的であった一方で、マルチタスク学習はサブタスクBおよびCにおいて最適であったため、異なるトレーニング戦略がタスクに応じて異なる利点を示すことがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。