Skip to main content
QUICK REVIEW

[論文レビュー] Sexism Prediction in Spanish and English Tweets Using Monolingual and Multilingual BERT and Ensemble Models

Angel Felipe Magnossão de Paula, Roberto Fray da Silva|arXiv (Cornell University)|Nov 8, 2021
Hate Speech and Cyberbullying Detection参考文献 15被引用数 5
ひとこと要約

本論文は、スペイン語および英語のツイートにおけるセクハラ検出と分類のための、多言語および単言語のBERTベースのアンサンブルシステムを提案する。このシステムは、微調整済みBERTモデル、データセットの翻訳によるデータ拡張、およびアンサンブル戦略を活用している。このシステムは、EXIST 2021の共有課題で1位を獲得し、セクハラ同定タスクで0.780の精度と0.780のF1スコアを達成した。分類タスクでは、0.658の精度と0.579のF1マクロスコアを記録し、多言語BERTベースラインよりそれぞれ3%および11%の向上を達成した。

ABSTRACT

The popularity of social media has created problems such as hate speech and sexism. The identification and classification of sexism in social media are very relevant tasks, as they would allow building a healthier social environment. Nevertheless, these tasks are considerably challenging. This work proposes a system to use multilingual and monolingual BERT and data points translation and ensemble strategies for sexism identification and classification in English and Spanish. It was conducted in the context of the sEXism Identification in Social neTworks shared 2021 (EXIST 2021) task, proposed by the Iberian Languages Evaluation Forum (IberLEF). The proposed system and its main components are described, and an in-depth hyperparameters analysis is conducted. The main results observed were: (i) the system obtained better results than the baseline model (multilingual BERT); (ii) ensemble models obtained better results than monolingual models; and (iii) an ensemble model considering all individual models and the best standardized values obtained the best accuracies and F1-scores for both tasks. This work obtained first place in both tasks at EXIST, with the highest accuracies (0.780 for task 1 and 0.658 for task 2) and F1-scores (F1-binary of 0.780 for task 1 and F1-macro of 0.579 for task 2).

研究の動機と目的

  • 多言語SNSにおけるセクハラコンテンツの同定と分類の課題に取り組むこと。特にスペイン語および英語に焦点を当てる。
  • 単言語BERT、データ翻訳、アンサンブル学習戦略を統合することで、多言語BERTベースラインを改善すること。
  • 異なるアンサンブル構成の有効性を評価し、セクハラ検出および分類性能の向上を検証すること。
  • 低リソース言語および高リソース言語の両方で展開可能なスケーラブルで柔軟なフレームワークを提供すること。
  • 専門家ラベル付きデータセットを用いた最先端のNLP技術を活用して、セクハラ同定および分類のベンチマークを確立すること。

提案手法

  • EXIST 2021データセットを用いて、英語およびスペイン語の単言語BERTモデルを微調整し、言語固有の表現学習を向上させる。
  • 多言語BERTをベースラインとして用い、単言語モデルおよびアンサンブルモデルとの性能を比較する。
  • 訓練データのバックトランスレーションを適用し、訓練データのサイズを拡大し、言語間での一般化性能を向上させる。
  • 単一のモデルの予測を組み合わせるシンプルな平均アンサンブル戦略を実装し、標準化されたラベル投票を含む。
  • 広範なアブレーションスタディを通じてハイパーパrameterを最適化し、公式の評価指標(タスク1:精度、タスク2:F1マクロ)を用いてモデルを評価する。
  • 最終的な予測を生成するために、すべての個々のモデルと最良の標準化ラベル値を組み合わせた最終アンサンブルモデルを用いる。

実験結果

リサーチクエスチョン

  • RQ1単語BERTモデルを用いることで、多言語BERTと比較してセクハラ検出および分類性能が向上するか?
  • RQ2バックトランスレーションによるデータ翻訳は、低リソース言語タスクにおけるモデル性能を向上させることができるか?
  • RQ3複数のBERTバージョンおよび予測戦略を組み合わせたアンサンブルモデルは、個々のモデルよりも優れた結果をもたらすか?
  • RQ4セクハラ同定および分類タスクにおけるF1スコアおよび精度を最大化する最適なアンサンブル構成は何か?
  • RQ5ハイパーパrameterの選択は、異なる言語およびタスク設定におけるモデル性能にどのように影響するか?

主な発見

  • すべての個々のモデルと最良の標準化ラベル値を組み合わせたアンサンブルモデルが最高のパフォーマンスを達成し、EXIST 2021の共有課題の両タスクで1位を獲得した。
  • セクハラ同定タスクでは、0.780の精度と0.780のF1スコアを達成し、多言語BERTベースラインよりF1スコアで約3%の向上を示した。
  • セクハラ分類タスクでは、0.658の精度と0.579のF1マクロスコアを記録し、多言語BERTベースラインよりF1マクロで11%の向上を達成した。
  • アンサンブルモデルは、一貫して個々の単語BERTおよび多言語BERTモデルを上回り、この文脈におけるモデル平均化の有効性を示した。
  • 翻訳された訓練データの使用は、特に低リソース環境においてモデルの一般化性能を向上させたが、主な利益はアンサンブル統合に起因していた。
  • ハイパーパrameter分析から、ラベル標準化および投票戦略が、特に多クラス分類において最終予測品質に顕著な影響を与えることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。