[论文解读] NLP-CUET@DravidianLangTech-EACL2021: Investigating Visual and Textual Features to Identify Trolls from Multimodal Social Media Memes
本文提出了一种多模态方法,用于检测使用视觉、文本和组合特征的德拉维达语社交媒体中的恶搞 meme。该方法利用 XLNet、VGG16 和 Inception 等模型进行迁移学习,在英文描述上使用 XLNet 实现了 0.58 的最高加权 F1 分数,在 EACL-2021 共享任务中获得第三名。
In the past few years, the meme has become a new way of communication on the Internet. As memes are the images with embedded text, it can quickly spread hate, offence and violence. Classifying memes are very challenging because of their multimodal nature and region-specific interpretation. A shared task is organized to develop models that can identify trolls from multimodal social media memes. This work presents a computational model that we have developed as part of our participation in the task. Training data comes in two forms: an image with embedded Tamil code-mixed text and an associated caption given in English. We investigated the visual and textual features using CNN, VGG16, Inception, Multilingual-BERT, XLM-Roberta, XLNet models. Multimodal features are extracted by combining image (CNN, ResNet50, Inception) and text (Long short term memory network) features via early fusion approach. Results indicate that the textual approach with XLNet achieved the highest weighted $f_1$-score of $0.58$, which enabled our model to secure $3^{rd}$ rank in this task.
研究动机与目标
- 开发一种计算模型,用于识别多模态社交媒体内容中的恶搞 meme,特别是在德拉维达语语境下。
- 研究视觉、文本和多模态特征在使用迁移学习分类恶搞 meme 时的有效性。
- 评估各种预训练模型——CNN、VGG16、Inception、XLNet、m-BERT、XLM-RoBERTa——在泰米尔语混合语 meme 数据集上的性能。
- 分析模型在数据不平衡数据集中的偏差与局限性,特别是恶搞 meme 的过度分类问题。
- 探索将图像和文本特征结合的早期融合策略,以提升多模态分类性能。
提出的方法
- 在包含泰米尔语混合文本的图像上训练视觉特征提取器(CNN、VGG16、Inception),以捕捉空间和语义模式。
- 使用基于 Transformer 的模型(XLNet、m-BERT、XLM-RoBERTa 和 XLNet)从英文描述中提取文本特征,利用其上下文表征能力。
- 通过早期融合将视觉和文本特征结合,即在分类前将图像和文本嵌入向量拼接。
- 使用 BiLSTM 网络对文本描述中的序列依赖关系进行建模,并用于多模态融合流程。
- 使用 ImageNet 预训练模型(如 ResNet50、Inception)和多语言 BERT 变体进行迁移学习,以提升在低资源数据上的泛化能力。
- 使用加权 F1 分数、精确率和召回率评估模型,模型选择基于验证集上的表现。
实验结果
研究问题
- RQ1在分类包含泰米尔语混合文本的社交媒体图像中的恶搞 meme 时,仅视觉、仅文本和多模态模型的表现如何比较?
- RQ2在低资源多语言环境下,哪种预训练语言模型——XLNet、m-BERT 或 XLM-RoBERTa——在英文描述上对恶搞检测表现最佳?
- RQ3与单模态方法相比,视觉和文本特征的早期融合是否能提升分类性能?
- RQ4为什么模型对将 meme 分类为“恶搞”表现出强烈偏差?数据不平衡和缺失描述在其中起到什么作用?
- RQ5跨类别重叠的视觉模式如何影响模型的泛化能力和性能?
主要发现
- 使用 XLNet 的文本模型实现了 0.583 的最高加权 F1 分数,优于所有视觉和多模态模型,在共享任务中获得第三名。
- 视觉模型(CNN、VGG16、Inception)的 F1 分数相近,约为 0.46,其中 Inception 的精确率(0.625)和召回率(0.597)略高。
- 采用早期融合的多模态模型(如 Inception + BiLSTM)实现了 0.559 的 F1 分数,相比仅视觉模型有所提升,但仍逊于最佳文本模型。
- 尽管 XLNet 是单语模型,但其表现优于多语言模型 m-BERT(F1:0.558)和 XLM-RoBERTa(F1:0.571),这可能是因为数据集中使用了英文描述。
- 所有模型均表现出对“恶搞”类别的显著偏差,超过 70% 的“非恶搞”meme 被错误分类为恶搞,主要由于数据不平衡和缺少描述。
- 错误分析显示,最佳多模态模型(Inception + BiLSTM)将 71 个总共有 395 个的恶搞 meme 错误分类为“非恶搞”,且将 200 个总共有 272 个的“非恶搞”meme 误标为恶搞,表明存在严重的类别不平衡问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。