Skip to main content
QUICK REVIEW

[论文解读] Multimodal and Explainable Internet Meme Classification

Abhinav Kumar Thakur, Filip Ilievski|arXiv (Cornell University)|Dec 11, 2022
Hate Speech and Cyberbullying Detection被引用 5
一句话总结

本文提出了一种模块化、可解释的多模态框架,用于使用基于示例和基于原型的推理对有害网络表情包进行分类,结合了最先进视觉与语言模型。该方法在仇恨言论和厌女言论检测中表现出色,同时通过检索并比较相似的训练样本,提供透明且人类可理解的解释。

ABSTRACT

In the current context where online platforms have been effectively weaponized in a variety of geo-political events and social issues, Internet memes make fair content moderation at scale even more difficult. Existing work on meme classification and tracking has focused on black-box methods that do not explicitly consider the semantics of the memes or the context of their creation. In this paper, we pursue a modular and explainable architecture for Internet meme understanding. We design and implement multimodal classification methods that perform example- and prototype-based reasoning over training cases, while leveraging both textual and visual SOTA models to represent the individual cases. We study the relevance of our modular and explainable models in detecting harmful memes on two existing tasks: Hate Speech Detection and Misogyny Classification. We compare the performance between example- and prototype-based methods, and between text, vision, and multimodal models, across different categories of harmfulness (e.g., stereotype and objectification). We devise a user-friendly interface that facilitates the comparative analysis of examples retrieved by all of our models for any given meme, informing the community about the strengths and limitations of these explainable methods.

研究动机与目标

  • 解决社交媒体中可扩展且公平的内容审核挑战,其中网络表情包被越来越多地用于传播仇恨言论和厌女言论。
  • 通过基于训练样本和原型的可解释推理,克服黑箱模型在表情包分类中的局限性。
  • 研究如何将SOTA视觉与语言模型的多模态表征与案例推理相结合,以在不牺牲性能的前提下提升可解释性。
  • 提供一个用户友好的界面,用于对比分析模型预测,使利益相关者能够评估可解释方法的优势与局限。
  • 考察MAMI和Hateful Memes等数据集中主观标注的影响,以及语境和文化知识在准确理解表情包中的作用。

提出的方法

  • 采用模块化架构,集成最先进的视觉模型(如CLIP、ViLBERT)和语言模型(如BERT-based),用于多模态特征提取。
  • 通过基于学习到的多模态嵌入,检索最相似的训练表情包,实现基于示例的推理,以解释预测结果。
  • 通过学习每种类别的代表性原型,实现基于原型的推理,使分类通过与特定类别的范例进行比较完成。
  • 使用对比学习和嵌入相似性度量(如余弦相似度)识别用于解释的相关训练案例。
  • 设计一种对比可视化界面,使用户能够检查并对比基于示例、基于原型和多模态模型的预测结果。
  • 在两个基准数据集Hateful Memes和MAMI上训练并评估模型,重点关注仇恨言论和厌女言论分类任务。

实验结果

研究问题

  • RQ1基于示例和基于原型的推理是否能在保持高准确率的同时提升多模态表情包分类的可解释性?
  • RQ2在不同类型的有害性(如物化、刻板印象)下,仅视觉、仅文本和多模态模型在分类有害表情包方面的表现如何比较?
  • RQ3基于训练样本的可解释方法在多大程度上能增强用户对模型预测的理解与信任,相较于黑箱模型?
  • RQ4MAMI和Hateful Memes等数据集中主观标注偏差对模型性能及解释可靠性有何影响?
  • RQ5语境和文化知识在正确理解网络表情包中扮演何种角色?如何将其整合进可解释AI框架?

主要发现

  • 基于示例的方法在准确率和可解释性方面均优于基于原型的方法,为最终用户提供了更直观、更具行动意义的解释。
  • 仅视觉模型的性能高于仅文本模型,表明视觉线索在表情包分类中更具判别力。
  • 视觉与语言表征的多模态融合取得了最佳整体性能,证实了模态融合的重要性。
  • MAMI数据集的标注者间一致性评分较低,凸显了对厌女和仇恨内容标注的主观性,以及由此带来的训练数据偏差。
  • 用户友好的界面支持了对模型预测的有效对比分析,揭示了不同表情包类型下各模型的具体优势与局限。
  • 尽管存在标注主观性挑战,所提出的框架证明了可解释多模态分类在现实内容审核中的可行性与有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。