Skip to main content
QUICK REVIEW

[论文解读] SemEval-2020 Task 8: Memotion Analysis -- The Visuo-Lingual Metaphor!

Chhavi Sharma, Deepesh Bhageria|arXiv (Cornell University)|Aug 9, 2020
Sentiment Analysis and Opinion Mining被引用 6
一句话总结

本文介绍了 SemEval-2020 任务 8——Memotion Analysis,这是一个用于分类互联网表情包中文本与视觉模态结合的多模态基准,旨在识别情感、情绪类型(讽刺、幽默、攻击性、激励性)及情绪强度。该任务发布了 10,000 个经人工标注的表情包,情感分类、情绪类型分类和情绪强度分类的 F1(宏平均)得分分别为 0.35、0.51 和 0.32,凸显了在表情包中实现多模态情绪理解的挑战。

ABSTRACT

Information on social media comprises of various modalities such as textual, visual and audio. NLP and Computer Vision communities often leverage only one prominent modality in isolation to study social media. However, the computational processing of Internet memes needs a hybrid approach. The growing ubiquity of Internet memes on social media platforms such as Facebook, Instagram, and Twiter further suggests that we can not ignore such multimodal content anymore. To the best of our knowledge, there is not much attention towards meme emotion analysis. The objective of this proposal is to bring the attention of the research community towards the automatic processing of Internet memes. The task Memotion analysis released approx 10K annotated memes, with human-annotated labels namely sentiment (positive, negative, neutral), type of emotion (sarcastic, funny, offensive, motivation) and their corresponding intensity. The challenge consisted of three subtasks: sentiment (positive, negative, and neutral) analysis of memes, overall emotion (humour, sarcasm, offensive, and motivational) classification of memes, and classifying intensity of meme emotion. The best performances achieved were F1 (macro average) scores of 0.35, 0.51 and 0.32, respectively for each of the three subtasks.

研究动机与目标

  • 为应对日益增长的、结合视觉与文本内容的多模态互联网表情包在情绪理解方面的分析挑战。
  • 提供一个大规模的人工标注数据集,包含 10,000 个表情包,附带情感、情绪类型和强度标签,以支持多模态情感计算研究。
  • 推动在社交媒体上日益普遍的讽刺、幽默、攻击性和激励性情绪自动检测研究。
  • 评估多模态融合技术在捕捉表情包细微情感内容方面相对于单模态方法的有效性。

提出的方法

  • 该任务包含三个子任务:情感分类(正面、负面、中性)、情绪类型分类(讽刺、幽默、攻击性、激励性)以及基于李克特量表的情绪强度量化。
  • 收集了一个多模态数据集,包含 10,000 个表情包,经人工标注情感、情绪类型和强度,包括提取的文本字幕和图像特征。
  • 基于多模态融合技术开发了基线模型,包括早期融合与晚期融合,并采用 ResNet-50、BiLSTM 和 RoBERTa 等模型进行视觉与文本特征提取。
  • 结合随机森林和 KNN 等统计建模方法与 MLP 等深度学习模型,评估融合性能。
  • 应用典型相关分析(CCA)与深度 CCA,评估图像与文本模态之间的相关性,结果表明两者更具有互补性而非相关性。
  • 鼓励参赛者分析各模态的贡献,许多模型在仅使用文本或图像特征时表现优于多模态融合模型,表明模态特定建模可能更有效。

实验结果

研究问题

  • RQ1多模态融合策略在识别互联网表情包中的情感与情绪类型方面效果如何?
  • RQ2与两者结合相比,视觉与文本模态在情绪识别中各自独立的贡献程度如何?
  • RQ3能否通过李克特量表标注方案可靠地量化表情包中情绪表达的强度?
  • RQ4为何某些模型在仅使用单一模态(文本或图像)时表现优于融合两者?
  • RQ5由于文化与语境依赖性,检测表情包中的讽刺、攻击性和幽默感的主要挑战是什么?

主要发现

  • 最佳系统在情绪类型分类任务中取得了 0.51 的宏平均 F1 得分,表明在识别讽刺、幽默、攻击性和激励性情绪方面取得中等成功。
  • 情感分类的宏平均 F1 得分为 0.35,反映出从多模态表情包内容中捕捉情感存在显著困难。
  • 强度分类的宏平均 F1 得分为 0.32,表明在量化情绪表达程度方面表现较差。
  • 许多表现优异的模型在仅使用文本或仅使用图像特征时表现更优,表明融合技术在表情包分析中未必总能提升性能。
  • 分析结果表明,表情包中的图像与文本更具有互补性而非相关性,挑战了基于对齐的融合方法为最优的假设。
  • 参赛者洞察强调了文化与语境知识在理解表情包中的重要性,尤其对于基于流行文化的特定领域表情包。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。