Skip to main content
QUICK REVIEW

[論文レビュー] Hateful Memes Detection via Complementary Visual and Linguistic Networks

Weibo Zhang, Guihua Liu|arXiv (Cornell University)|Dec 9, 2020
Hate Speech and Cyberbullying Detection参考文献 16被引用数 14
ひとこと要約

本論文は、視覚的・言語的特徴を統合するため、ViLBERTとVisualBERTアーキテクチャの融合を用いて、文脈レベルおよび感受性オブジェクトレベルの特徴を視覚的・言語的モダリティから統合する、補完的視覚的・言語的(CVL)ネットワークを提案する。この手法は、Hateful Memes Challenge 2020のテストセットで78.48%のAUROCおよび72.95%の精度を達成し、補完的マルチモーダル表現学習により性能が向上していることを示している。

ABSTRACT

Hateful memes are widespread in social media and convey negative information. The main challenge of hateful memes detection is that the expressive meaning can not be well recognized by a single modality. In order to further integrate modal information, we investigate a candidate solution based on complementary visual and linguistic network in Hateful Memes Challenge 2020. In this way, more comprehensive information of the multi-modality could be explored in detail. Both contextual-level and sensitive object-level information are considered in visual and linguistic embedding to formulate the complex multi-modal scenarios. Specifically, a pre-trained classifier and object detector are utilized to obtain the contextual features and region-of-interests (RoIs) from the input, followed by the position representation fusion for visual embedding. While linguistic embedding is composed of three components, i.e., the sentence words embedding, position embedding and the corresponding Spacy embedding (Sembedding), which is a symbol represented by vocabulary extracted by Spacy. Both visual and linguistic embedding are fed into the designed Complementary Visual and Linguistic (CVL) networks to produce the prediction for hateful memes. Experimental results on Hateful Memes Challenge Dataset demonstrate that CVL provides a decent performance, and produces 78:48% and 72:95% on the criteria of AUROC and Accuracy. Code is available at https://github.com/webYFDT/hateful.

研究の動機と目的

  • SNSにおける嫌がらせのためのミームを検出する課題に取り組む。単一モダリティのアプローチでは、複雑なマルチモーダル相互作用のため失敗する。
  • 既存の視覚的・言語的フレームワークが、グローバルな文脈的特徴とローカルな感受性オブジェクトレベルの情報を同時に捉えることの限界を克服する。
  • 画像とテキストの両方から得られる文脈的および感受性オブジェクトレベルの手がかりを統合することで、特徴理解を向上させる補完的マルチモーダル表現を開発する。
  • 事前学習モデルと、ViLBERTとVisualBERTを組み合わせた新しい統合戦略を活用することで、Hateful Memes Challenge 2020での性能を向上させる。

提案手法

  • 入力画像から、Visual Genome上で事前学習されたFaster R-CNN検出器を用いて、100個の領域(RoI)特徴とボクセル境界を抽出する。
  • 空間的位置符号化を組み合わせることで、RoI特徴と位置表現を統合し、強化された視覚的埋め込みを生成する。
  • BERTベースのトークン埋め込み、位置符号化、およびSpacyを用いて抽出されたSembedding(Sembedding)を用いて、言語的埋め込みを構築する。
  • 視覚的および言語的埋め込みを、ViLBERT(共注意力)とVisualBERT(自己注意力)を用いた二重ストリームアーキテクチャで統合し、分類の前に最終表現を連結する。
  • Adam最適化アルゴリズムを用い、バッチサイズ80、学習率1e-5(ViLBERT用)および5e-5(VisualBERT用)で、2,000イテレーションのウォームアップを伴う交差エントロピー損失でモデルを訓練する。
  • 同じラベルのサンプル間での一般化を向上させるために、トレーニング中にサンプル増強戦略を適用する。

実験結果

リサーチクエスチョン

  • RQ1視覚的および言語的モダリティから得られる文脈レベルおよび感受性オブジェクトレベルの特徴を統合することで、嫌がらせのためのミーム検出が向上するか?
  • RQ2二重ストリームの視覚的・言語的モデル(ViLBERTおよびVisualBERT)の統合は、単一ストリームまたは単モダリティベースラインと比較して、性能をどのように向上させるか?
  • RQ3SpacyベースのSembeddingを組み込むことで、マルチモーダルな嫌がらせ検出における言語的表現はどの程度向上するか?
  • RQ4提案されたCVLネットワークは、Hateful Memes Challenge 2020ベンチマークにおいて、既存のマルチモーダル事前学習フレームワークを上回る性能を発揮するか?

主な発見

  • CVLネットワークは、Hateful Memes Challenge 2020 Stage-2のテストセットで78.48%のAUROCおよび72.95%の精度を達成し、個々のモデルおよび先行するマルチモーダルベースラインを上回った。
  • ViLBERTとVisualBERTの後期連結による統合により、最高の個別ベースライン(文脈的およびSembedding特徴を有するVisualBERT)と比較して、AUROCが4.57ポイント向上した。
  • ViLBERTおよびVisualBERTにSembeddingを追加することで、それぞれ文脈特徴のみのバージョンと比較して、AUROCが4.77ポイントおよび1.52ポイント向上した。
  • 公式評価では、CVLモデルは66.2%の精度および75.02%のAUROCを達成し、複雑で現実世界の嫌がらせのためのミームサンプルに対する強力な一般化能力を示した。
  • 二重ストリームアーキテクチャにおける自己注意力と共注意力の組み合わせにより、微妙な嫌がらせの兆候の理解が向上した。
  • 提案されたサンプル増強戦略は、未知のデータに対するロバストネスと性能向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。