Skip to main content
QUICK REVIEW

[論文レビュー] NLP-CUET@DravidianLangTech-EACL2021: Investigating Visual and Textual Features to Identify Trolls from Multimodal Social Media Memes

Eftekhar Hossain, Omar Sharif|arXiv (Cornell University)|Feb 28, 2021
Misinformation and Its Impacts参考文献 19被引用数 10
ひとこと要約

本論文は、視覚的、言語的、および統合的特徴を用いてドゥラヴィディア語圏のソーシャルメディアにおけるトール・ミームを検出するマルチモーダルアプローチを提示する。XLNet、VGG16、Inceptionなどのモデルを用いたトランスファー学習を活用し、英語のキャプションを用いたXLNetで最高の加重F1スコア0.58を達成し、EACL-2021合同タスクで3位を獲得した。

ABSTRACT

In the past few years, the meme has become a new way of communication on the Internet. As memes are the images with embedded text, it can quickly spread hate, offence and violence. Classifying memes are very challenging because of their multimodal nature and region-specific interpretation. A shared task is organized to develop models that can identify trolls from multimodal social media memes. This work presents a computational model that we have developed as part of our participation in the task. Training data comes in two forms: an image with embedded Tamil code-mixed text and an associated caption given in English. We investigated the visual and textual features using CNN, VGG16, Inception, Multilingual-BERT, XLM-Roberta, XLNet models. Multimodal features are extracted by combining image (CNN, ResNet50, Inception) and text (Long short term memory network) features via early fusion approach. Results indicate that the textual approach with XLNet achieved the highest weighted $f_1$-score of $0.58$, which enabled our model to secure $3^{rd}$ rank in this task.

研究の動機と目的

  • マルチモーダルなソーシャルメディアコンテンツ、特にドゥラヴィディア語圏の文脈におけるトール・ミームを識別するための計算モデルの開発。
  • トランスファー学習を用いて、視覚的、言語的、およびマルチモーダル特徴の有効性を検証すること。
  • タミル語のコードミックスド・ミームデータセット上で、CNN、VGG16、Inception、XLNet、m-BERT、XLM-RoBERTaといったさまざまな事前学習モデルの性能を評価すること。
  • 不均衡なデータセットにおけるモデルのバイアスと限界を分析すること、特にトール・ミームの過剰分類の要因を特定すること。
  • 画像とテキスト特徴を統合する早期統合戦略を検討し、マルチモーダル分類の性能向上を図ること。

提案手法

  • 埋め込まれたタミル語のコードミックスドテキストを有する画像に対して、視覚的特徴抽出器(CNN、VGG16、Inception)を訓練し、空間的および意味的パターンを捉える。
  • トランスフォーマー基盤のモデル(XLNet、m-BERT、XLM-RoBERTa、XLNet)を用いて英語キャプションからの言語的特徴を抽出し、文脈表現能力を活用する。
  • 画像とテキストの埋め込みを分類の前に連結することで、視覚的および言語的特徴を早期統合する。
  • テキストキャプション内の順序的依存関係をモデル化するためにBiLSTMネットワークを用い、マルチモーダル統合パイプラインで使用する。
  • ImageNet事前学習モデル(例:ResNet50、Inception)および多言語Bertバージョンを用いたトランスファー学習により、低リソースデータに対する汎化性能を向上させる。
  • 検証セットの性能に基づき、モデル選択を行うとともに、加重F1スコア、適合率、再現率を用いてモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1コードミックスドのタミル語ソーシャルメディア画像からのトール・ミーム分類において、視覚的のみ、言語的のみ、およびマルチモーダルモデルの性能はどのように比較されるか?
  • RQ2英語キャプションを用いた場合、低リソース多言語環境におけるトール検出において、XLNet、m-BERT、XLM-RoBERTa のうちどの事前学習言語モデルが最も優れているか?
  • RQ3視覚的および言語的特徴の早期統合は、単一モodalアプローチに比べて分類性能を向上させるか?
  • RQ4なぜモデルは『トール』クラスに強くバイアスを示すのか?データの不均衡および欠落したキャプションが果たす役割は何か?
  • RQ5クラス間で重複する視覚的パターンが、モデルの汎化性能および性能に与える影響は何か?

主な発見

  • XLNetを用いた言語的モデルが、加重F1スコア0.583を達成し、視覚的およびマルチモーダルモデルをすべて上回り、共同タスクで3位を獲得した。
  • 視覚的モデル(CNN、VGG16、Inception)は、F1スコア約0.46を達成し、Inceptionはわずかに高い適合率(0.625)と再現率(0.597)を示した。
  • 早期統合を用いたマルチモーダルモデル(例:Inception + BiLSTM)はF1スコア0.559を達成し、視覚的のみのモデルより性能が向上したが、最良の言語的モデルには及ばなかった。
  • 多言語モデル(m-BERT:F1 0.558、XLM-RoBERTa:F1 0.571)を上回ったが、XLNetは単言語モデルであるにもかかわらず、データセットに英語キャプションが多かったため、その効果が顕著に現れたと考えられる。
  • すべてのモデルが『トール』クラスに顕著なバイアスを示し、70%を超える『not-troll』ミームが誤って『トール』と分類された。主な要因はデータの不均衡およびキャプションの欠落である。
  • 誤差解析の結果、最良のマルチモーダルモデル(Inception + BiLSTM)が395個のトール・ミームのうち71個(約18%)を『not-troll』に誤分類した一方、272個の『not-troll』ミームのうち200個(約73.5%)が誤って『トール』とラベル付けされた。これは、強いクラスの不均衡問題が顕在していることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。