Skip to main content
QUICK REVIEW

[论文解读] MARMOT: A Deep Learning Framework for Constructing Multimodal Representations for Vision-and-Language Tasks

Patrick Y. Wu, Walter R. Mebane|arXiv (Cornell University)|Sep 23, 2021
Multimodal Machine Learning Applications参考文献 9被引用 5
一句话总结

MARMOT 是一种深度学习框架,通过用模态转换替代计算成本高昂的预训练,构建视觉-语言任务的多模态表征,即使图像或文本缺失也能实现有效的表征学习。在2016年美国大选期间的选举事件推文分类任务中,MARMOT 在20个类别中的19个类别上优于纯文本模型,在 Hateful Memes 数据集上将 VisualBERT 的准确率提升2.87%,AUC 提升3.89%。

ABSTRACT

Political activity on social media presents a data-rich window into political behavior, but the vast amount of data means that almost all content analyses of social media require a data labeling step. However, most automated machine classification methods ignore the multimodality of posted content, focusing either on text or images. State-of-the-art vision-and-language models are unusable for most political science research: they require all observations to have both image and text and require computationally expensive pretraining. This paper proposes a novel vision-and-language framework called multimodal representations using modality translation (MARMOT). MARMOT presents two methodological contributions: it can construct representations for observations missing image or text, and it replaces the computationally expensive pretraining with modality translation. MARMOT outperforms an ensemble text-only classifier in 19 of 20 categories in multilabel classifications of tweets reporting election incidents during the 2016 U.S. general election. Moreover, MARMOT shows significant improvements over the results of benchmark multimodal models on the Hateful Memes dataset, improving the best result set by VisualBERT in terms of accuracy from 0.6473 to 0.6760 and area under the receiver operating characteristic curve (AUC) from 0.7141 to 0.7530.

研究动机与目标

  • 为解决当前视觉-语言模型在政治科学研究中应用的局限性,这些模型要求每个样本同时具备图像和文本,并依赖昂贵的预训练过程。
  • 实现在图像或文本可能缺失的多模态社交媒体数据上的有效表征学习。
  • 通过基于模态转换的方法替代计算密集型的预训练,高效学习跨模态关系。
  • 提升在现实世界政治和社会媒体数据上的分类性能,这些数据常见多模态内容但常不完整。
  • 为缺乏高端计算资源的社会科学家提供一种实用且可访问的框架。

提出的方法

  • MARMOT 采用基于 Transformer 的架构,通过模态转换学习联合多模态表征,即从一种模态重建另一种模态。
  • 采用双编码器设置:一个用于图像特征,一个用于文本特征,并通过交叉注意力机制对齐两者。
  • 框架将标准预训练替换为基于模态转换的对比学习目标,支持零样本或少样本适应新领域。
  • 通过学习生成或关注相关表征,支持模态缺失的情况,即使某一模态缺失也能保持性能。
  • 通过在验证集上进行网格搜索调整超参数,使用加权 Adam 优化器并配合余弦学习率调度。
  • 在初始冻结语言模型和模态转换解码器后,对模型进行端到端微调以保证稳定性。

实验结果

研究问题

  • RQ1视觉-语言框架是否能在不依赖每个样本同时具备图像和文本的情况下,在政治科学数据上实现强性能?
  • RQ2模态转换是否能替代昂贵的预训练,同时在多模态理解任务上保持或提升性能?
  • RQ3MARMOT 在分类社交媒体上的选举事件报告时,与纯文本和多模态基线模型相比表现如何?
  • RQ4与最先进模型相比,MARMOT 在 Hateful Memes 基准上的性能提升程度如何?
  • RQ5MARMOT 是否能在模态缺失或不完整的现实社交媒体数据上实现良好泛化?

主要发现

  • 在2016年美国大选期间的选举事件推文分类任务中,MARMOT 在20个多标签类别中的19个类别上优于纯文本集成分类器。
  • 在 Hateful Memes 数据集上,MARMOT 的准确率为 0.6580,AUC 为 0.7587,优于 VisualBERT 的准确率(0.6473)和 AUC(0.7141)。
  • 与 VisualBERT 相比,MARMOT 在准确率上提升 2.87 个百分点,在 AUC 上提升 3.89 个百分点,表现出显著的性能提升。
  • 模型展现出稳定的训练动态,初始4个训练周期参数冻结后,验证准确率单调上升。
  • MARMOT 对模态缺失表现出鲁棒性,在仅存在单一模态时仍能保持性能。
  • 该框架在 Hateful Memes 验证集上取得了最先进结果,且无需在大规模图文配对数据集上进行完整预训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。