[论文解读] Multimodal Learning for Hateful Memes Detection
本文提出了一种新颖的三元关系网络(TRN),通过建模视觉区域、图像字幕和文本内容之间的跨模态关系,整合图像字幕生成、目标检测与OCR文本,以提升仇恨表情包的检测性能。该方法在仇恨表情包挑战赛第二阶段取得SOTA性能,测试F1得分为74.80%,在276支队伍中排名第13位,使用视觉与语言特征及生成的字幕。
Memes are used for spreading ideas through social networks. Although most memes are created for humor, some memes become hateful under the combination of pictures and text. Automatically detecting the hateful memes can help reduce their harmful social impact. Unlike the conventional multimodal tasks, where the visual and textual information is semantically aligned, the challenge of hateful memes detection lies in its unique multimodal information. The image and text in memes are weakly aligned or even irrelevant, which requires the model to understand the content and perform reasoning over multiple modalities. In this paper, we focus on multimodal hateful memes detection and propose a novel method that incorporates the image captioning process into the memes detection process. We conduct extensive experiments on multimodal meme datasets and illustrated the effectiveness of our approach. Our model achieves promising results on the Hateful Memes Detection Challenge.
研究动机与目标
- 解决仇恨表情包检测中图文内容弱对齐或语义无关的挑战。
- 通过引入生成的图像字幕作为额外模态,提升仇恨表情包检测中的多模态推理能力。
- 建模视觉区域、OCR文本与图像字幕之间的复杂跨模态关系,以实现更精确的分类。
- 评估图像字幕与语言数据增强在提升仇恨表情包检测多模态表征学习方面的有效性。
提出的方法
- 集成图像字幕生成模型,为表情包生成描述性字幕,为多模态推理提供额外语义上下文。
- 使用目标检测器提取视觉区域特征(RoIs),并将其与OCR提取的文本及生成的字幕相结合。
- 采用三元关系网络(TRN),利用交叉注意力机制建模图像字幕、检测到的物体与OCR文本三者之间的关系。
- 采用双流(V&L)与单流(V+L)的Transformer架构,分别编码视觉与文本特征后再进行融合。
- 利用回译技术进行数据增强,以提升文本模态的鲁棒性,尤其在双流设置下表现更优。
- 将物体标签视为语言标记,与OCR文本及字幕拼接,以增强跨模态对齐。

实验结果
研究问题
- RQ1生成的图像字幕是否能通过提供额外语义上下文,提升仇恨表情包检测模型的性能?
- RQ2三元关系网络在建模表情包中图像字幕、检测物体与OCR文本之间的关系方面效果如何?
- RQ3通过回译进行语言数据增强是否能提升模型泛化能力,尤其是在双流架构中?
- RQ4当与字幕和OCR文本结合时,物体标签在多大程度上增强了跨模态对齐?
- RQ5所提出方法与现有多模态融合方法相比,在仇恨表情包检测基准上的表现如何?
主要发现
- 所提方法结合图像字幕与多模态融合,在仇恨表情包挑战赛第二阶段测试F1得分为74.80%,在276支队伍中排名第13位。
- 采用图像字幕的V&L模型优于所有其他V&L基线模型,证明了生成字幕在提升跨模态推理能力方面的有效性。
- 回译在双流(V&L)模型中提升了性能,但在单流(V+L)模型中未见提升,表明独立模态建模更受益于增强后的文本。
- 物体标签显著提升了V+L与V&L模型的性能,作为视觉区域与文本特征之间的有效锚点。
- 三元关系网络有效捕捉了图像内容、字幕与文本之间的隐含关系,即使OCR文本与图像语义不一致,也能实现正确分类。
- 定性结果表明,模型能通过利用生成的图像字幕,正确识别出文本与图像不一致或具有讽刺意味的仇恨表情包中的仇恨意图。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。