[论文解读] Team Yao at Factify 2022: Utilizing Pre-trained Models and Co-attention Networks for Multi-Modal Fact Verification
该论文提出 Pre-CoFact,一种使用预训练 DeBERTa 和 DeiT 模型进行文本和图像特征提取的多模态事实核查框架,并通过协同注意力网络融合跨模态和同模态表示。该方法在未使用辅助任务或 OCR 数据的情况下,于 Factify 2022 挑战赛中取得了 74.585% 的 F1 分数,位列第 5 名。
In recent years, social media has enabled users to get exposed to a myriad of misinformation and disinformation; thus, misinformation has attracted a great deal of attention in research fields and as a social issue. To address the problem, we propose a framework, Pre-CoFact, composed of two pre-trained models for extracting features from text and images, and multiple co-attention networks for fusing the same modality but different sources and different modalities. Besides, we adopt the ensemble method by using different pre-trained models in Pre-CoFact to achieve better performance. We further illustrate the effectiveness from the ablation study and examine different pre-trained models for comparison. Our team, Yao, won the fifth prize (F1-score: 74.585\%) in the Factify challenge hosted by De-Factify @ AAAI 2022, which demonstrates that our model achieved competitive performance without using auxiliary tasks or extra information. The source code of our work is publicly available at https://github.com/wywyWang/Multi-Modal-Fact-Verification-2021
研究动机与目标
- 为应对社交媒体中虚假信息传播日益加剧的挑战,特别是图文结合的多模态虚假新闻。
- 开发一种鲁棒的事实核查系统,利用文本和视觉内容,而不依赖 OCR 或外部数据。
- 通过协同注意力机制建模跨模态与模内依赖关系,提升多模态事实核查性能。
- 在零样本或极少数据设置下,评估不同预训练模型与集成策略的有效性。
提出的方法
- 该框架使用 DeBERTa-base 对文本声明和文档进行编码,使用 DeiT-base-patch16-224 对图像进行编码。
- 应用协同注意力模块以融合跨模态(文本与图像)及同模态内(声明与文档的文本/图像)的特征。
- 将四种嵌入表示——文本、图像、跨注意力与协同注意力——拼接后分类为五种类别之一。
- 通过集成策略结合多种 Pre-CoFact 变体,使用不同的预训练模型(如 RoBERTa、XLM-RoBERTa)和激活函数(如 Mish),以提升泛化能力。
- 在微调过程中冻结 DeBERTa 和 DeiT 的模型参数,以保留预训练知识。
- 数据预处理包括将图像调整为 256x256,中心裁剪为 224x224,并进行归一化;文本序列截断为 512 个 token。
实验结果
研究问题
- RQ1仅使用原始文本和图像,不依赖 OCR 或辅助数据,多模态事实核查系统能否实现具有竞争力的性能?
- RQ2协同注意力机制在建模多模态事实核查中的跨模态与模内依赖关系方面有多有效?
- RQ3在该多模态设置下,哪些预训练模型(如 DeBERTa、RoBERTa、XLM-RoBERTa、DeiT、DINO)表现最佳?
- RQ4模型集成在多模态事实核查中在多大程度上提升了鲁棒性与性能?
主要发现
- 所提出的 Pre-CoFact 框架在验证集上取得了 78.46% 的加权 F1 分数,集成模型达到 80.02%。
- 消融实验证实,协同注意力机制显著提升性能,当移除协同注意力时,F1 分数下降 4.34%。
- 仅在同模态内使用协同注意力(如 文本-文本 或 图像-图像)的性能(76.43%)低于完整协同注意力模型(78.46%),表明跨模态注意力的必要性。
- 集成方法使性能相比基础 Pre-CoFact 模型提升 1.56 个百分点,证明其在增强泛化能力方面的有效性。
- 在预训练模型中,DeBERTa 和 DeiT 表现优于 XLM-RoBERTa 和 RoBERTa,且 DeiT 在该任务上的表现优于 DINO。
- 该模型在测试集上取得 74.585% 的 F1 分数,在 Factify 2022 挑战赛中位列第 5 名,较基线模型提升 40.5%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。