Skip to main content
QUICK REVIEW

[论文解读] Cross-media Structured Common Space for Multimedia Event Extraction

Manling Li, Alireza Zareian|arXiv (Cornell University)|May 5, 2020
Multimodal Machine Learning Applications参考文献 65被引用 8
一句话总结

本文提出了多模态事件抽取(M2E2),这是一个新颖的任务,旨在联合从文本和图像中抽取事件及其论元。该研究提出弱对齐结构嵌入(WASE),一种基于图的方法,利用弱监督在跨模态中学习共享语义空间,实现对结构化事件表示的联合建模,相比最先进单模态方法提升9.8%的F值,并通过利用视觉数据使事件提及数增加21.4%。

ABSTRACT

We introduce a new task, MultiMedia Event Extraction (M2E2), which aims to extract events and their arguments from multimedia documents. We develop the first benchmark and collect a dataset of 245 multimedia news articles with extensively annotated events and arguments. We propose a novel method, Weakly Aligned Structured Embedding (WASE), that encodes structured representations of semantic information from textual and visual data into a common embedding space. The structures are aligned across modalities by employing a weakly supervised training strategy, which enables exploiting available resources without explicit cross-media annotation. Compared to uni-modal state-of-the-art methods, our approach achieves 4.0% and 9.8% absolute F-score gains on text event argument role labeling and visual event extraction. Compared to state-of-the-art multimedia unstructured representations, we achieve 8.3% and 5.0% absolute F-score gains on multimedia event extraction and argument role labeling, respectively. By utilizing images, we extract 21.4% more event mentions than traditional text-only methods.

研究动机与目标

  • 为解决多模态新闻中联合事件抽取的空白,提出一项新任务——多模态事件抽取(M2E2),整合文本与视觉的事件及论元抽取。
  • 为克服跨媒体标注数据稀缺的问题,开发一种弱监督训练框架,利用现有单模态标注数据与图文对,实现跨模态对齐。
  • 实现在无需显式跨媒体标注的情况下,实现跨模态联合推理,提升真实多媒体场景下的鲁棒性与可扩展性。
  • 利用基于图的神经网络建模复杂事件结构与论元角色,通过共享嵌入空间编码语义关系。
  • 证明结构化多媒体表示在捕捉整体事件语义方面优于平面嵌入,尤其在论元定位与指代消解任务中表现更优。

提出的方法

  • 该方法为每个句子和图像构建图表示,其中节点代表事件或实体,边代表论元角色,实现对事件语义的结构化建模。
  • 采用弱监督训练策略,利用独立标注的文本与视觉事件数据集,以及图文对,实现模态对齐,无需依赖跨媒体标注。
  • 通过端到端训练节点与边嵌入,学习共享多媒体通用语义空间,以解决事件指代消解问题,并实现跨模态中图像与相关句子的匹配。
  • 模型利用注意力机制定位图像中的论元实例,即使在训练阶段无边界框监督,也能聚焦于相关视觉区域。
  • 应用图神经网络在节点与边之间传播并优化嵌入,捕捉文本与视觉事件表示中的关系结构。
  • 该框架在来自多个来源与领域的异构数据上进行端到端训练,具备向新事件类型与模态迁移的可扩展性与可转移性。

实验结果

研究问题

  • RQ1弱监督框架能否在无需显式跨媒体标注的情况下,有效对齐文本与视觉事件表示?
  • RQ2与平面表示学习相比,将事件结构建模为图是否能提升多媒体事件抽取性能?
  • RQ3在多媒体新闻中,视觉数据在多大程度上可超越仅依赖文本的方法,提升事件提及检测效果?
  • RQ4在训练阶段无边界框标注的情况下,能否有效实现图像中论元的定位?
  • RQ5所提出的结构化通用空间在多样化数据源、领域与事件类型上的泛化能力如何?

主要发现

  • 所提出的WASE方法在基于文本的事件论元角色标注任务上,相比最先进单模态方法,F值绝对提升9.8%。
  • WASE在视觉事件抽取任务上,相比最佳单模态基线,F值绝对提升4.0%。
  • 与多媒体平面表示方法相比,WASE在多媒体事件抽取与论元角色标注任务上,分别实现8.3%与5.0%的F值绝对提升。
  • 通过引入视觉数据,模型比仅使用文本的基线多抽取21.4%的事件提及,证明了多模态信号的价值。
  • 模型成功利用注意力机制在图像中定位论元,即使无边界框监督,但当存在多个候选对象时,注意力可能失去焦点。
  • 在异构、多源数据上的实验表明,该框架在不同领域与模态间具备强大的可扩展性与可转移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。