[论文解读] MOMENTA: A Multimodal Framework for Detecting Harmful Memes and Their Targets
MOMENTA 是一种新颖的多模态深度学习框架,通过分析上下文中的局部和全局图文交互,检测有害表情包并识别其社会目标。该框架在两个新数据集——Harm-C(新冠疫情)和 Harm-P(美国政治)——上,相较于十个基线模型,绝对准确率提升了1.3%–2.6%,并展现出强大的可解释性与跨领域泛化能力。
Internet memes have become powerful means to transmit political, psychological, and socio-cultural ideas. Although memes are typically humorous, recent days have witnessed an escalation of harmful memes used for trolling, cyberbullying, and abuse. Detecting such memes is challenging as they can be highly satirical and cryptic. Moreover, while previous work has focused on specific aspects of memes such as hate speech and propaganda, there has been little work on harm in general. Here, we aim to bridge this gap. We focus on two tasks: (i)detecting harmful memes, and (ii)identifying the social entities they target. We further extend a recently released HarMeme dataset, which covered COVID-19, with additional memes and a new topic: US politics. To solve these tasks, we propose MOMENTA (MultimOdal framework for detecting harmful MemEs aNd Their tArgets), a novel multimodal deep neural network that uses global and local perspectives to detect harmful memes. MOMENTA systematically analyzes the local and the global perspective of the input meme (in both modalities) and relates it to the background context. MOMENTA is interpretable and generalizable, and our experiments show that it outperforms several strong rivaling approaches.
研究动机与目标
- 为解决检测那些并非明显仇恨或冒犯性,但因语境和多模态协同作用而造成伤害的有害表情包这一研究空白。
- 识别有害表情包所针对的具体社会实体,这是以往仇恨或冒犯性检测研究中尚未充分探索的任务。
- 通过新增示例和新主题(美国政治),扩展 HarMeme 数据集,以支持对有害性检测系统更广泛的评估。
- 开发一种能有效整合背景语境的模型,超越单模态或早期融合方法,提升检测性能。
- 确保模型在多种表情包类型和领域之间的可解释性与泛化能力。
提出的方法
- MOMENTA 采用双分支架构,分别使用预训练的视觉和语言编码器(如 ViT 和 BERT)对图像和文本特征进行编码。
- 应用局部和全局注意力机制,捕捉细微的视觉线索(如手势、面部表情)以及图像与文本之间的全局语义一致性。
- 通过来自外部知识源或上下文编码器的背景语境嵌入,融合多模态表示。
- 采用对比学习目标,将有害表情包的表示与目标对齐,提升对细微伤害的判别能力。
- 通过 Grad-CAM 和基于 LIME 的显著性图实现可解释性,突出显示对预测有贡献的关键图像区域和文本标记。
- 在扩展的 HarMeme 数据集上端到端微调模型,并采用对抗性训练和归一化技术以提升鲁棒性。
实验结果
研究问题
- RQ1整合背景语境在多大程度上提升了对细微、依赖语境的有害表情包的检测能力?
- RQ2多模态模型在多大程度上能够区分那些并非明显冒犯或仇恨,但仍具伤害性的表情包?
- RQ3统一框架是否能在一个架构中有效检测有害表情包及其针对的社会实体?
- RQ4MOMENTA 在多样化的表情包检测任务中,与强基线的单模态和多模态方法相比表现如何?
- RQ5哪些关键视觉和文本线索对模型预测有贡献?其可解释性如何?
主要发现
- 在 Harm-C 和 Harm-P 两个数据集上,MOMENTA 相较于十个强基线模型,有害表情包检测的绝对准确率提升了 1.3%–2.6%。
- 该模型展现出优越的泛化能力,在未见主题和领域(包括原初以新冠疫情为中心之外的美国政治)上表现良好。
- 可解释性分析显示,关键有害线索(如矛盾的手势、特定词汇如 'CAMPAIGNING')被显著性图正确突出。
- 尽管性能优异,当伤害源于根深蒂固的语义含义而非显式的视觉或文本线索时,模型仍会失败,表明仍需更强的语境推理能力。
- 该框架能以高精度成功识别表情包的目标(如乔·拜登、唐纳德·特朗普),这是以往研究中较少支持的能力。
- 消融实验证实,局部与全局多模态建模,以及背景语境的引入,对实现最佳性能至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。