[论文解读] BLUE at Memotion 2.0 2022: You have my Image, my Text and my Transformer
本论文介绍了团队 BLUE 在 MEMOTION 2.0 2022 共享任务中的获胜方法,提出了一种仅基于文本的 BERT 方法以及一种融合图像与文本特征的多模态多任务(MMT)Transformer 模型。经过 CLIP 和 CORAL 优化的 MMT 模型在情感分析任务中获得第一名(F1=0.5318),在幽默检测任务中获得第二名(F1=0.8059),在反讽与冒犯性内容检测任务中位列第三,所有任务的平均得分最高。
Memes are prevalent on the internet and continue to grow and evolve alongside our culture. An automatic understanding of memes propagating on the internet can shed light on the general sentiment and cultural attitudes of people. In this work, we present team BLUE's solution for the second edition of the MEMOTION shared task. We showcase two approaches for meme classification (i.e. sentiment, humour, offensive, sarcasm and motivation levels) using a text-only method using BERT, and a Multi-Modal-Multi-Task transformer network that operates on both the meme image and its caption to output the final scores. In both approaches, we leverage state-of-the-art pretrained models for text (BERT, Sentence Transformer) and image processing (EfficientNetV4, CLIP). Through our efforts, we obtain first place in task A, second place in task B and third place in task C. In addition, our team obtained the highest average score for all three tasks.
研究动机与目标
- 开发针对情感、幽默、反讽、冒犯性与动机等细粒度 meme 分类的鲁棒多模态模型。
- 探究利用最先进的预训练模型融合文本与视觉特征在多模态 meme 理解中的有效性。
- 评估不同模态组合与特征提取器(如 CLIP、EfficientNetV4)对分类性能的影响。
- 通过 CORAL 实现域自适应,解决 meme 情绪强度预测中的有序回归挑战。
- 通过自监督预训练与词法归一化提升在噪声多、类别不平衡的 meme 数据集上的泛化能力。
提出的方法
- 对从 meme 中提取的文本字幕微调 BERT 和 Sentence Transformers,实现仅基于文本的分类。
- 设计了一种多模态多任务(MMT)Transformer,联合处理来自 EfficientNetV4 和 BERT 的图像与文本嵌入。
- 将 CLIP 特征作为额外的视觉编码器,以提升多模态表征学习能力。
- 应用 CORAL(域自适应)进行有序回归,以建模幽默与反讽等情绪的强度等级。
- 通过消融研究评估不同模态组合(仅文本、仅图像、仅 CLIP、融合)的特征贡献。
- 在所有任务中均使用加权 F1 分数作为主要指标,并通过模型集成与超参数调优完成最终提交。
实验结果
研究问题
- RQ1仅基于文本的 BERT 方法与多模态模型在 meme 情感与情绪分类上的表现如何比较?
- RQ2在不同 meme 分类任务中,图像、文本与 CLIP 特征的相对贡献是什么?
- RQ3基于 CORAL 的域自适应能否提升 meme 中情绪强度预测的有序回归性能?
- RQ4是否存在一种在所有 meme 情绪任务中均表现最优的模态组合,还是性能因任务而异?
- RQ5自监督预训练与词法归一化如何提升在噪声多、类别不平衡的 meme 数据集上的鲁棒性?
主要发现
- 融合图像、文本与 CLIP 特征的 MMT Transformer 在所有三项任务中取得了最高的平均 F1 分数(0.6273),优于所有其他团队。
- 仅基于文本的 BERT 模型在幽默检测任务中获得第二名(F1=0.7743),并在幽默与冒犯性任务中表现最佳。
- MMT 模型在情感分析任务中排名第一(F1=0.5318),优于仅基于文本的模型(F1=0.5072)。
- 在反讽与冒犯性内容检测任务中,MMT 模型显著优于仅基于文本的模型,F1 分别达到 0.8191 和 0.5581。
- 消融研究显示,不同模态组合之间的性能差异极小,表明 CLIP 与图像特征提供了稳定且微小的增益。
- 该团队在所有三项任务中均取得最高平均分,证明了 MMT 方法的鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。