[论文解读] Cross-media Structured Common Space for Multimedia Event Extraction
本文提出了多模态事件抽取(M2E2),这是一个新颖的任务,旨在联合从文本和图像中抽取事件及其论元。该研究提出弱对齐结构嵌入(WASE),一种基于图的方法,利用弱监督在跨模态中学习共享语义空间,实现对结构化事件表示的联合建模,相比最先进单模态方法提升9.8%的F值,并通过利用视觉数据使事件提及数增加21.4%。
We introduce a new task, MultiMedia Event Extraction (M2E2), which aims to extract events and their arguments from multimedia documents. We develop the first benchmark and collect a dataset of 245 multimedia news articles with extensively annotated events and arguments. We propose a novel method, Weakly Aligned Structured Embedding (WASE), that encodes structured representations of semantic information from textual and visual data into a common embedding space. The structures are aligned across modalities by employing a weakly supervised training strategy, which enables exploiting available resources without explicit cross-media annotation. Compared to uni-modal state-of-the-art methods, our approach achieves 4.0% and 9.8% absolute F-score gains on text event argument role labeling and visual event extraction. Compared to state-of-the-art multimedia unstructured representations, we achieve 8.3% and 5.0% absolute F-score gains on multimedia event extraction and argument role labeling, respectively. By utilizing images, we extract 21.4% more event mentions than traditional text-only methods.
研究动机与目标
- 为解决多模态新闻中联合事件抽取的空白,提出一项新任务——多模态事件抽取(M2E2),整合文本与视觉的事件及论元抽取。
- 为克服跨媒体标注数据稀缺的问题,开发一种弱监督训练框架,利用现有单模态标注数据与图文对,实现跨模态对齐。
- 实现在无需显式跨媒体标注的情况下,实现跨模态联合推理,提升真实多媒体场景下的鲁棒性与可扩展性。
- 利用基于图的神经网络建模复杂事件结构与论元角色,通过共享嵌入空间编码语义关系。
- 证明结构化多媒体表示在捕捉整体事件语义方面优于平面嵌入,尤其在论元定位与指代消解任务中表现更优。
提出的方法
- 该方法为每个句子和图像构建图表示,其中节点代表事件或实体,边代表论元角色,实现对事件语义的结构化建模。
- 采用弱监督训练策略,利用独立标注的文本与视觉事件数据集,以及图文对,实现模态对齐,无需依赖跨媒体标注。
- 通过端到端训练节点与边嵌入,学习共享多媒体通用语义空间,以解决事件指代消解问题,并实现跨模态中图像与相关句子的匹配。
- 模型利用注意力机制定位图像中的论元实例,即使在训练阶段无边界框监督,也能聚焦于相关视觉区域。
- 应用图神经网络在节点与边之间传播并优化嵌入,捕捉文本与视觉事件表示中的关系结构。
- 该框架在来自多个来源与领域的异构数据上进行端到端训练,具备向新事件类型与模态迁移的可扩展性与可转移性。
实验结果
研究问题
- RQ1弱监督框架能否在无需显式跨媒体标注的情况下,有效对齐文本与视觉事件表示?
- RQ2与平面表示学习相比,将事件结构建模为图是否能提升多媒体事件抽取性能?
- RQ3在多媒体新闻中,视觉数据在多大程度上可超越仅依赖文本的方法,提升事件提及检测效果?
- RQ4在训练阶段无边界框标注的情况下,能否有效实现图像中论元的定位?
- RQ5所提出的结构化通用空间在多样化数据源、领域与事件类型上的泛化能力如何?
主要发现
- 所提出的WASE方法在基于文本的事件论元角色标注任务上,相比最先进单模态方法,F值绝对提升9.8%。
- WASE在视觉事件抽取任务上,相比最佳单模态基线,F值绝对提升4.0%。
- 与多媒体平面表示方法相比,WASE在多媒体事件抽取与论元角色标注任务上,分别实现8.3%与5.0%的F值绝对提升。
- 通过引入视觉数据,模型比仅使用文本的基线多抽取21.4%的事件提及,证明了多模态信号的价值。
- 模型成功利用注意力机制在图像中定位论元,即使无边界框监督,但当存在多个候选对象时,注意力可能失去焦点。
- 在异构、多源数据上的实验表明,该框架在不同领域与模态间具备强大的可扩展性与可转移性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。