Skip to main content
QUICK REVIEW

[論文レビュー] Classification of Multimodal Hate Speech -- The Winning Solution of Hateful Memes Challenge

Xiayu Zhong|arXiv (Cornell University)|Dec 2, 2020
Hate Speech and Cyberbullying Detection参考文献 16被引用数 13
ひとこと要約

この論文では、事前学習済みのビジョン・ランゲージモデル(例:VisualBERT)とデータ駆動型ルールを組み合わせたハイブリッドマルチモーダル嫌がらせスパム分類モデルを提示している。Hateful Memesチャレンジにおいて最先端の性能を達成するために、訓練データからルールを抽出して困難な「3タプル」および「2タプル」のミームを処理し、MRMファインチューニングを適用し、モデルスタッキングを用いた5分割交差検証を実施した。その結果、86.8%の精度と0.923のAUROCを達成し、コンペティションで1位を獲得した。

ABSTRACT

Hateful Memes is a new challenge set for multimodal classification, focusing on detecting hate speech in multimodal memes. Difficult examples are added to the dataset to make it hard to rely on unimodal signals, which means only multimodal models can succeed. According to Kiela,the state-of-the-art methods perform poorly compared to humans (64.73% vs. 84.7% accuracy) on Hateful Memes. I propose a new model that combined multimodal with rules, which achieve the first ranking of accuracy and AUROC of 86.8% and 0.923 respectively. These rules are extracted from training set, and focus on improving the classification accuracy of difficult samples.

研究の動機と目的

  • インターネット上のミームにおけるマルチモーダル嫌がらせスパム分類の課題に対処すること。単一モodalな信号では、微妙で文脈依存性の高い嫌がらせを特定できないため。
  • 画像とテキストの相互作用に依存するが、孤立した手がかりに依存しない曖昧で難しいミームの性能を向上させること。
  • 既存のマルチモーダルモデルがレアまたは複雑なミームパターンを処理する際の限界を、ルールベースのポストプロセッシングとデータ拡張によって克服すること。
  • 限られたラベル付きデータで、現実世界の極めて不均衡なマルチモーダル分類設定において、AUROCと精度を最大化すること。

提案手法

  • Hateful Memesデータセット上で視覚的特徴表現学習を改善するため、マスク領域モデリング(MRM)を用いてVisualBERTをファインチューニングした。
  • 訓練データから分類ルールを抽出した。具体的には、繰り返しの画像やテキストを持つ「3タプル」および「2タプル」のミームに特化し、偽ラベルを生成した。
  • ルールラベルを付与された「3タプル」のテストサンプルを訓練セットに挿入することで、半教師あり学習を適用し、モデルの一般化性能を向上させた。
  • モデルスタッキングの前段階で、ルールベースの確率補正を予測値に適用した。前処理による調整が、スタッキング後の調整よりも優れた結果を示した。
  • 20個の異なるモデル(4つのベースモデル × 5分割)を用いた5分割交差検証を実施し、最終アンサンブル予測には単純な等重量平均を適用した。
  • 過学習を低減し、モデルの頑健性を向上させるために、20個のベースモデル予測を等重量平均でスタッキングした。

実験結果

リサーチクエスチョン

  • RQ1ルールベースのポストプロセッシングは、困難で曖昧なミームにおけるマルチモーダル嫌がらせスパム検出を顕著に改善できるか?
  • RQ2ルール抽出による偽ラベルを用いた半教師ありデータインジェクションは、限られた訓練データ上でモデル性能をどの程度向上させられるか?
  • RQ3事前学習済みのVisualBERTにMRMを適用することで、標準的なファインチューニングと比較してHateful Memesベンチマーク上での性能が向上するか?
  • RQ4ベースモデルに早期にルールを適用する(予測前)ことと、スタックされた予測に対して遅く適用する(予測後)ことのどちらが、AUROCと精度の向上により効果的か?
  • RQ5ディープラーニングとシンボリックルールを組み合わせたハイブリッドアプローチは、純粋なニューラルネットワークモデルを上回る性能を示せるか?

主な発見

  • ハイブリッドモデルは86.8%の精度と0.923のAUROCを達成し、Hateful Memesチャレンジで1位を獲得した。
  • VisualBERTにMRMを適用することで、最高性能を示したバージョンのAUROCが0.726から0.740に向上し、その有効性が裏付けられた。
  • 「3タプル」ミームに対するルールベースのラベリングにより、AUROCと精度が10%以上向上した。これは、半教師ありデータインジェクションの価値を示している。
  • モデルスタッキングの前段階でルール2による予測値の補正を実施したところ、AUROCが3.2%向上し、スタッキング後の補正よりも優れた性能を示した。
  • 20個の交差検証済みモデルの等重量平均が、ロジスティック回帰やMLPのようなより複雑なスタッキング手法を上回った。
  • 特に「3タプル」および「2タプル」ミームのような困難なサンプルにおいて、性能が顕著に向上した。これは、ルールベース推論がマルチモーダルNLPにおけるディープラーニングを補完できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。