Skip to main content
QUICK REVIEW

[论文解读] VMSMO: Learning to Generate Multimodal Summary for Video-based News Articles

Mingzhe Li, Xiuying Chen|arXiv (Cornell University)|Oct 12, 2020
Topic Modeling参考文献 36被引用 7
一句话总结

本文提出了基于视频的多模态摘要生成与多模态输出(VMSMO)这一新任务,该任务联合选择一个突出的视频封面帧并为附带视频的新闻文章生成简洁的文本摘要。作者提出了基于双重交互的多模态摘要模型(DIMS),该模型利用条件自注意力机制和全局注意力机制,以建模视频的时间动态特性和跨模态语义,从而在新收集的大规模数据集上,在自动评估和人工评估中均取得了最先进性能。

ABSTRACT

A popular multimedia news format nowadays is providing users with a lively video and a corresponding news article, which is employed by influential news media including CNN, BBC, and social media including Twitter and Weibo. In such a case, automatically choosing a proper cover frame of the video and generating an appropriate textual summary of the article can help editors save time, and readers make the decision more effectively. Hence, in this paper, we propose the task of Video-based Multimodal Summarization with Multimodal Output (VMSMO) to tackle such a problem. The main challenge in this task is to jointly model the temporal dependency of video with semantic meaning of article. To this end, we propose a Dual-Interaction-based Multimodal Summarizer (DIMS), consisting of a dual interaction module and multimodal generator. In the dual interaction module, we propose a conditional self-attention mechanism that captures local semantic information within video and a global-attention mechanism that handles the semantic relationship between news text and video from a high level. Extensive experiments conducted on a large-scale real-world VMSMO dataset show that DIMS achieves the state-of-the-art performance in terms of both automatic metrics and human evaluations.

研究动机与目标

  • 为解决从附带视频的新闻文章中生成有效多模态摘要的挑战,其中既需要代表性封面帧,又需要简洁的文本摘要。
  • 建模视频中的时间依赖关系与文本中的语义含义,二者为本质上不同的模态。
  • 开发一个统一框架,同时完成封面帧选择与抽象式文本摘要生成。
  • 构建一个大规模真实世界数据集,用于VMSMO任务,以支持稳健评估。
  • 证明摘要生成与封面帧选择的多任务学习可同时提升两项任务的性能。

提出的方法

  • 该模型使用循环神经网络(RNNs)分别编码视频帧和文本文章的序列结构。
  • 引入双交互模块,包含一种条件自注意力机制,用于在文章上下文引导下捕捉局部视频表征;以及一种全局注意力机制,用于建模高层级的跨模态关系。
  • 条件自注意力机制根据文章上下文关注视频帧,从而在文本引导下增强局部视频表征。
  • 全局注意力机制计算文章词语与视频帧之间的注意力权重,实现在高层级的跨模态对齐。
  • 多模态生成器利用双交互模块融合的表征,生成抽象式摘要并选择封面帧。
  • 模型采用多任务学习目标进行端到端训练,同时优化摘要生成与封面帧选择任务。

实验结果

研究问题

  • RQ1统一模型能否联合生成高质量的文本摘要并从附带视频的新闻文章中选择代表性封面帧?
  • RQ2如何有效利用相关新闻文章的语义内容来引导局部视频表征?
  • RQ3在文本与视频之间建模全局跨模态注意力在多大程度上能提升摘要生成与帧选择性能?
  • RQ4摘要生成与封面帧选择的多任务学习是否能带来两项任务的性能增益?
  • RQ5所提出的注意力机制相较于消融变体,在多大程度上提升了模型的有效性?

主要发现

  • DIMS模型在VMSMO基准上达到最先进性能,在自动指标(ROUGE-L、BLEU)和人工评估中均优于所有基线模型。
  • 全局注意力机制对文本摘要生成贡献最大,而条件自注意力机制对准确的封面帧选择最为关键。
  • 消融实验表明,条件自注意力与全局注意力模块均不可或缺,任一移除均导致性能显著下降。
  • 多任务学习提升了两项任务:与单任务基线相比,完整DIMS模型在ROUGE-L上提升20.8%,在mAP准确率上提升7.0%。
  • 注意力矩阵可视化显示,模型能正确将关键文章词语(如“Book Fair”、“hand in hand”)与语义相关的视频帧对齐。
  • 案例研究显示,生成的摘要语言流畅、事实准确,且与真实参考摘要一致,所选封面帧与参考帧高度匹配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。