Skip to main content
QUICK REVIEW

[论文解读] N24News: A New Dataset for Multimodal News Classification

Zhen Wang, Shan Xu|arXiv (Cornell University)|Aug 30, 2021
Topic Modeling参考文献 23被引用 8
一句话总结

本文介绍了 N24News,这是一个大规模多模态新闻数据集,包含来自《纽约时报》的 60,000 组图像-文本对,涵盖 24 个类别。通过使用多任务多模态网络,研究结果表明,与仅使用文本的模型相比,结合文本和图像特征可将分类准确率提高最多 8.11%,凸显了在新闻分类中多模态融合的价值。

ABSTRACT

Current news datasets merely focus on text features on the news and rarely leverage the feature of images, excluding numerous essential features for news classification. In this paper, we propose a new dataset, N24News, which is generated from New York Times with 24 categories and contains both text and image information in each news. We use a multitask multimodal method and the experimental results show multimodal news classification performs better than text-only news classification. Depending on the length of the text, the classification accuracy can be increased by up to 8.11%. Our research reveals the relationship between the performance of a multimodal classifier and its sub-classifiers, and also the possible improvements when applying multimodal in news classification. N24News is shown to have great potential to prompt the multimodal news studies.

研究动机与目标

  • 为解决公开可用的大规模多模态新闻数据集缺乏问题,这些数据集需同时包含文本和图像特征。
  • 探究结合视觉与文本特征是否能显著提升新闻分类性能,超越仅使用文本的方法。
  • 分析多模态分类器性能与其子分类器(文本模型与图像模型)之间的关系。
  • 评估多模态融合技术在真实世界新闻分类任务中的有效性。
  • 为未来多模态新闻理解研究提供基准数据集与基线模型。

提出的方法

  • N24News 数据集从《纽约时报》档案中构建,被整理为 24 个新闻类别,包含平衡的图像-文本对。
  • 提出一种多任务多模态神经网络,其中共享分支与模态特定分支分别处理文本和图像输入,随后进行融合。
  • 通过拼接来自预训练文本编码器(如 BERT 类模型)和视觉编码器(如 ViT 或 ResNet)的深度特征,实现特征融合。
  • 使用交叉熵损失,通过联合优化文本头、图像头和多模态头,端到端训练模型。
  • 评估多种融合策略(如加权求和与基于注意力的融合),以比较性能表现。
  • 在 24 类分类任务上,使用标准准确率指标,将模型性能与仅使用文本的基线模型进行基准对比。

实验结果

研究问题

  • RQ1与仅使用文本的模型相比,多模态学习是否能显著提升新闻分类准确率?
  • RQ2多模态分类器的性能与其中独立的文本和图像子分类器性能之间有何关系?
  • RQ3在新闻分类中,组合图像与文本特征的最佳融合策略是什么?
  • RQ4视觉特征在区分相似新闻类别方面贡献有多大?
  • RQ5数据集的类别平衡程度与模态质量如何影响多模态模型的泛化能力?

主要发现

  • 所提出的多模态方法相比仅使用文本的模型,最高可实现 8.11% 的分类准确率提升,证明了视觉特征在新闻分类中的价值。
  • 多模态分类器的性能与各子分类器(文本与图像)的性能密切相关,表明构建稳健的模态特定模型对融合成功至关重要。
  • 在评估设置中,采用模态特定归一化的特征拼接优于简单的早期或晚期融合策略。
  • 在语义模糊或视觉信息丰富的类别(如体育、旅游、美食)中,模型表现出显著性能提升,图像提供了关键上下文信息。
  • 错误分析显示,多模态模型在仅靠文本存在歧义或误导的情况下,能有效减少误分类。
  • N24News 数据集被证明是未来多模态新闻研究的可行基准,具有类别平衡分布和现实世界相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。