Skip to main content
QUICK REVIEW

[论文解读] UVCE-IIITT@DravidianLangTech-EACL2021: Tamil Troll Meme Classification: You need to Pay more Attention

Siddhanth U Hegde, Adeep Hande|arXiv (Cornell University)|Apr 19, 2021
Humor Studies and Applications参考文献 10被引用 21
一句话总结

本文提出了一种基于多模态Transformer的模型,结合视觉Transformer(ViT)与多语言BERT(mBERT),用于对泰米尔语表情包进行二分类(是否为恶意内容)。该模型通过晚期交互方式融合视觉与文本特征,在验证集上取得0.96的F1分数,但由于数据分布偏移及图像中文本位置偏差,测试集上的性能显著下降(F1=0.46)。

ABSTRACT

Tamil is a Dravidian language that is commonly used and spoken in the southern part of Asia. In the era of social media, memes have been a fun moment in the day-to-day life of people. Here, we try to analyze the true meaning of Tamil memes by categorizing them as troll and non-troll. We propose an ingenious model comprising of a transformer-transformer architecture that tries to attain state-of-the-art by using attention as its main component. The dataset consists of troll and non-troll images with their captions as text. The task is a binary classification task. The objective of the model is to pay more attention to the extracted features and to ignore the noise in both images and text.

研究动机与目标

  • 解决在多语言、多模态社交媒体环境中对泰米尔语网络表情包进行恶意/非恶意分类的挑战。
  • 开发一种稳健的自动化系统,用于检测可能传播仇恨或虚假信息的讽刺或攻击性内容。
  • 探究结合视觉与文本Transformer在低资源、低资源德拉维达语表情包分类中的有效性。
  • 分析图像预处理(特别是通过中心裁剪去除嵌入文本)对模型泛化能力与性能的影响。

提出的方法

  • 在去除文本的中心裁剪后,对调整为224×224大小的泰米尔语表情包图像进行视觉Transformer(ViT)微调,使用ImageNet预训练权重,并采用ImageNet统计量进行归一化。
  • 通过去除停用词、标点符号与特殊字符对标题进行预处理,随后进行分词并输入mBERT(base-multilingual-cased)以获取上下文嵌入。
  • 通过256维融合层连接ViT与mBERT的池化输出,随后应用ReLU激活函数与Dropout正则化。
  • 使用交叉熵损失与线性热身学习率调度策略,通过单神经元分类头进行二分类(恶意/非恶意)训练。
  • 使用批量大小16,在4个周期内以2e-5的学习率进行微调,标题输入序列长度限制为128个标记。
  • 未应用数据增强以保留图像语义,尤其考虑到数据集规模较小(共2,699个表情包)。

实验结果

研究问题

  • RQ1结合ViT与mBERT的多模态Transformer架构能否有效对泰米尔语表情包进行恶意/非恶意分类?
  • RQ2通过中心裁剪去除嵌入文本对基于视觉的表情包分类模型性能有何影响?
  • RQ3为何模型在验证集上表现优异,但在测试集上性能显著下降?
  • RQ4视觉与文本特征的晚期融合在多模态分类中相较于单一模态的提升程度如何?
  • RQ5图像布局中的分布偏移(如文本位置变化)如何影响ViT模型在未见表情包数据上的泛化能力?

主要发现

  • 当仅使用ViT的图像特征时,模型在验证集上取得了0.96的F1分数,表明在验证划分上表现强劲。
  • 当仅基于标题使用mBERT进行分类时,模型取得了0.93的F1分数,表明文本内容本身具有高度信息量。
  • 尽管验证集加权F1为1.00,模型在测试集上性能严重下降,仅取得0.46的F1分数。
  • 验证集与测试集性能差异归因于分布偏移,特别是图像中文本的位置与存在性变化。
  • 通过中心裁剪去除嵌入文本虽提升了验证集性能,但可能损害了泛化能力,因测试集包含更多复杂或位置不同的文本。
  • 通过晚期交互融合ViT与mBERT特征未导致性能下降,且可能有助于提升验证集准确率,但未能完全缓解过拟合问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。