Skip to main content
QUICK REVIEW

[論文レビュー] NLPDove at SemEval-2020 Task 12: Improving Offensive Language Detection with Cross-lingual Transfer

Hwijeen Ahn, Jimin Sun|arXiv (Cornell University)|Aug 4, 2020
Hate Speech and Cyberbullying Detection参考文献 31被引用数 5
ひとこと要約

本稿では、SemEval-2020 タスク12における性能向上を図るために、多言語間転送とデータ拡張を活用した多言語的攻撃的言語検出システムNLPDoveを提示する。他言語からの転送可能な例を特定するために翻訳埋め込み距離(TED)を導入し、mBERTの微調整を言語固有の前処理で強化することで、ギリシャ語(1位)、デンマーク語(3位)、トルコ語(5位)で最先端の結果を達成した。

ABSTRACT

This paper describes our approach to the task of identifying offensive languages in a multilingual setting. We investigate two data augmentation strategies: using additional semi-supervised labels with different thresholds and cross-lingual transfer with data selection. Leveraging the semi-supervised dataset resulted in performance improvements compared to the baseline trained solely with the manually-annotated dataset. We propose a new metric, Translation Embedding Distance, to measure the transferability of instances for cross-lingual data selection. We also introduce various preprocessing steps tailored for social media text along with methods to fine-tune the pre-trained multilingual BERT (mBERT) for offensive language identification. Our multilingual systems achieved competitive results in Greek, Danish, and Turkish at OffensEval 2020.

研究の動機と目的

  • 特に二値の攻撃的/非攻撃的ラベルしか利用できない状況における低リソース多言語環境における攻撃的言語検出の課題に対処すること。
  • 半教師ありラベルと多言語間データ転送を活用することで、モデルの汎化性と耐性を向上させること。
  • 攻撃的語彙の存在に依存するのを避け、データ拡張と前処理を通じて文脈理解を促進することで、制限を克服すること。
  • ノイズの多いソーシャルメディアテキストに対応するためのカスタマイズされた前処理を用いた多言語Bert(mBERT)の微調整の有効性を調査すること。
  • 多言語間学習における効果的なデータ選択のため、言語間での例の転送可能性を定量化する信頼性のあるメトリクスを開発すること。

提案手法

  • 英語の学習セットに、半教師ありデータセットからの高信頼度予測をフィルタリングして統合することで、データ拡張を実施する。
  • 多言語間データ選択のための新しいメトリクスとして、翻訳埋め込み距離(TED)を提案し、ソース言語とターゲット言語の例間の意味的類似度を測定する。
  • ユーザーメンション、URL、ハッシュタグ、絵文字などを処理するため、言語固有の前処理パイプラインを実装する。
  • 複数の表現層、プーリング機構、ランダムシードを用いたmBERTの微調整により、耐性を向上させる。
  • 複数のmBERTバリアントを組み合わせたアンサンブルモデルを構築し、予測の安定性と性能を向上させる。
  • 訓練中に攻撃的語彙をマスキングすることで文脈に配慮した学習を促進するが、定量的な向上は得られなかった。

実験結果

リサーチクエスチョン

  • RQ1モデル予測から得られる半教師ありラベルは、低リソース環境における攻撃的言語検出性能を向上させることができるか?
  • RQ2異なる言語間で転送可能な例を選択することで、攻撃的言語検出における多言語間転送の有効性はどの程度か?
  • RQ3提案された翻訳埋め込み距離(TED)メトリクスは、多言語間転送のためのデータ選択をどの程度改善するか?
  • RQ4ソーシャルメディアテキストに特化した前処理は、ノイズが多く非公式な言語の文脈でのモデル性能を向上させるか?
  • RQ5訓練中に攻撃的語彙をマスキングすることで、文脈理解が向上し、語彙的キーワードへの依存が減少するか?

主な発見

  • 手動ラベルのみで学習したベースラインモデルに比べ、半教師ありラベルの使用が性能向上をもたらした。
  • 提案されたTEDメトリクスは、転送可能な例を効果的に同定し、多言語間転送の性能向上に寄与した。
  • 異なるプーリング機構とランダムシードを用いたmBERTのアンサンブルモデルは、強力な結果を達成した。ギリシャ語(1位)でマクロF1スコア0.85、デンマーク語(3位)で0.79、トルコ語(5位)で0.80を記録した。
  • 努力の甲斐あっても、訓練中の語彙マスキングは性能向上をもたらさず、むしろ悪影響を及ぼした可能性がある。これは、本物の攻撃的語彙が過剰にマスキングされたためと推測される。
  • 定性的分析の結果、モデルは依然として攻撃的でない文脈(例:"f*cking awesome")でも攻撃的語彙に過剰に依存していることが判明した。
  • 英語(15位/86)とアラビア語(20位/54)でも競争力のある結果を達成しており、本手法がリソースレベルが異なる言語間でもスケーラブルであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。