Skip to main content
QUICK REVIEW

[论文解读] Enhance Multimodal Transformer With External Label And In-Domain Pretrain: Hateful Meme Challenge Winning Solution

Ron Zhu|arXiv (Cornell University)|Dec 15, 2020
Hate Speech and Cyberbullying Detection参考文献 15被引用 46
一句话总结

本工作将四个视觉-语言变换器进行集成,并用外部标签(实体/种族/性别)和领域内预训练进行增强,以在仇恨表情包检测挑战赛中获胜,在数据集上达到 0.845 AUROC。

ABSTRACT

Hateful meme detection is a new research area recently brought out that requires both visual, linguistic understanding of the meme and some background knowledge to performing well on the task. This technical report summarises the first place solution of the Hateful Meme Detection Challenge 2020, which extending state-of-the-art visual-linguistic transformers to tackle this problem. At the end of the report, we also point out the shortcomings and possible directions for improving the current methodology.

研究动机与目标

  • 通过对图像与文本之外的更深层次的多模态理解,推动更高水平的仇恨表情包检测。
  • 将外部知识线索(实体、种族、性别)纳入以增强视觉-语言表示。
  • 利用领域内预训练和集成方法提升在 Hateful Memes 数据集上的性能。
  • 评估外部标签的输入如何与不同的 VL transformer 架构交互。

提出的方法

  • 将 VL-BERT、UNITER、VILLA 和 ERNIE-Vil 扩展为用于仇恨表情包检测的四模型集成。
  • 将外部标签表示为与图像区域相关联的特殊文本标记,以与多模态骨干网络融合。
  • 复用 UNITER 的 ITM 头为该任务微调的图像-文本匹配信号。
  • 通过 Google Vision Web Entity Detection 和 FairFace 标签从数据源中提取额外信息。
  • 讨论知识图驱动方法的潜力(如 MHGRN)作为未来工作,以整合外部知识。

实验结果

研究问题

  • RQ1外部标签和领域内预训练能否将仇恨表情包检测提升到超越标准 VL 变换器的水平?
  • RQ2在多模态仇恨言论任务中,外部知识线索如何与不同的 VL 架构交互?
  • RQ3重复使用预训练头(如 UNITER ITM)是否能减少语言偏见并提高泛化?
  • RQ4额外数据源(网络实体、人口统计属性)对模型性能的贡献是多少?

主要发现

  • 在所提集成与扩展下,在仇恨表情包数据集上达到 0.845 AUROC。
  • 应用实体/种族/性别标签显著提升了扩展的 VL-BERT 和 ERNIE-Vil 的开发集表现(对某些单流模型影响较小)。
  • 复用 UNITER ITM 头在 dev-seen 上相对于随机初始化的优势(0.778 vs 0.765 AUROC)。
  • ERNIe-Vil 与 VL-BERT 因跨模态融合优势而受益于外部标签;不同架构的结果存在差异。
  • 强调将图像、文本和外部知识结合以判断表情包极性的重要性,以及知识图谱驱动方法在未来工作的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。