[论文解读] Overview of Memotion 3: Sentiment and Emotion Analysis of Codemixed Hinglish Memes
本论文提出了 Memotion 3,这是一个针对印地语-英语(印英混用)表情包的多模态情感与情绪分析共享任务,引入了一个包含10,000个样本的标注数据集。参赛者使用了CLIP、BERT和ViT等模型,情感分类最佳F1得分为34.41%,情绪识别为79.77%,情绪强度预测为59.82%。在代码混用语境中,反讽和幽默尤其具有挑战性。
Analyzing memes on the internet has emerged as a crucial endeavor due to the impact this multi-modal form of content wields in shaping online discourse. Memes have become a powerful tool for expressing emotions and sentiments, possibly even spreading hate and misinformation, through humor and sarcasm. In this paper, we present the overview of the Memotion 3 shared task, as part of the DeFactify 2 workshop at AAAI-23. The task released an annotated dataset of Hindi-English code-mixed memes based on their Sentiment (Task A), Emotion (Task B), and Emotion intensity (Task C). Each of these is defined as an individual task and the participants are ranked separately for each task. Over 50 teams registered for the shared task and 5 made final submissions to the test set of the Memotion 3 dataset. CLIP, BERT modifications, ViT etc. were the most popular models among the participants along with approaches such as Student-Teacher model, Fusion, and Ensembling. The best final F1 score for Task A is 34.41, Task B is 79.77 and Task C is 59.82.
研究动机与目标
- 开发并评估用于印地语-英语(印英混用)表情包中情感与情绪分析的多模态模型,此类内容是复杂且富含文化内涵的在线交流形式。
- 解决在代码混用、多模态内容中检测细微情感与情绪的挑战,其中反讽、幽默和文化语境对理解有重大影响。
- 提供一个基准数据集与共享任务,以推动自动表情包理解的研究,特别是针对印地语-英语等低资源语言对。
- 识别当前模型在处理代码混用表情包中的反讽、幽默和攻击性内容方面的局限性,揭示现有NLP与视觉系统中的差距。
提出的方法
- 任务发布了包含10,000个样本的印英混用表情包数据集,分别标注了情感(任务A)、情绪(任务B)和情绪强度(任务C),各项任务独立评估。
- 参赛者采用结合预训练视觉编码器(如ViT、CLIP)与文本编码器(如BERT、RoBERTa)的多模态架构,处理图文对。
- 常用技术包括模型集成、知识蒸馏(学生-教师)以及视觉与文本表征的后期融合,以提升预测鲁棒性。
- 表现最佳的系统使用微调后的CLIP与基于BERT的模型,并添加任务特定的输出头层,常通过引入位置嵌入或损失函数修改来适应代码混用。
- 评估基于保留的测试集上的F1分数进行,各项任务独立排名,以确保情感、情绪与强度预测之间的公平比较。
- 对误分类样本进行了分析,识别出持续存在的失败模式,尤其集中在反讽与幽默检测方面,重点关注代码混用的语言模式。

实验结果
研究问题
- RQ1当前多模态模型在检测代码混用的印英混用表情包情感方面效果如何,尤其是在涉及反讽与幽默时?
- RQ2在印英混用表情包中,哪些情绪类别最具挑战性?语言代码混用与多模态线索如何影响模型性能?
- RQ3现有预训练模型(如CLIP与BERT)在情绪强度预测任务中,对低资源、代码混用的多模态数据泛化能力如何?
- RQ4为何某些表情包——尤其是涉及幽默或反讽的——被所有参赛模型持续误分类?
- RQ5能否开发统一的基线模型,以提升在代码混用表情包理解中多个情绪与情感任务的性能?
主要发现
- 情感分类(任务A)的最佳F1得分为34.41%,表明仍有显著提升空间,尤其考虑到反讽与代码混用的复杂性。
- 情绪分类(任务B)表现最佳,F1得分为79.77%,其中“幽默”与“反讽”是最难检测的情绪类别。
- 情绪强度预测(任务C)的最佳F1得分为59.82%,其中“非常反讽”与“非常搞笑”是最常被误分类的类别。
- 在任务C中,超过400个表情包被所有团队误分类,其中大部分为代码混用,表明在建模多模态与语言复杂性方面仍存在持久挑战。
- 仅有两支团队——NUAA-QMUL-AIIT与NYCU_TWO——在所有三项任务中均优于基线,凸显了在此多模态、代码混用设置中泛化能力的困难。
- 大量误分类样本(任务A为121个,任务B为231个,任务C为421个)为代码混用且与幽默或反讽相关,证实了这些是当前模型的关键失败点。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。