Skip to main content
QUICK REVIEW

[论文解读] Dual-Gated Fusion with Prefix-Tuning for Multi-Modal Relation Extraction

Qian Li, Shu Guo|arXiv (Cornell University)|Jun 19, 2023
Natural Language Processing TechniquesComputer Science被引用 3
一句话总结

本文提出 DGF-PT,一种新颖的多模态关系抽取框架,通过双门控融合与前缀调优技术,捕捉实体对、文本与视觉输入之间的细粒度关联。通过采用面向实体与面向对象的前缀,以及双门控融合模块,该模型能有效识别并整合有用的视觉线索,同时过滤掉噪声或具有误导性的信息,在少样本设置下尤其表现出色,达到当前最优性能。

ABSTRACT

Multi-Modal Relation Extraction (MMRE) aims at identifying the relation between two entities in texts that contain visual clues. Rich visual content is valuable for the MMRE task, but existing works cannot well model finer associations among different modalities, failing to capture the truly helpful visual information and thus limiting relation extraction performance. In this paper, we propose a novel MMRE framework to better capture the deeper correlations of text, entity pair, and image/objects, so as to mine more helpful information for the task, termed as DGF-PT. We first propose a prompt-based autoregressive encoder, which builds the associations of intra-modal and inter-modal features related to the task, respectively by entity-oriented and object-oriented prefixes. To better integrate helpful visual information, we design a dual-gated fusion module to distinguish the importance of image/objects and further enrich text representations. In addition, a generative decoder is introduced with entity type restriction on relations, better filtering out candidates. Extensive experiments conducted on the benchmark dataset show that our approach achieves excellent performance compared to strong competitors, even in the few-shot situation.

研究动机与目标

  • 为解决多模态关系抽取(MMRE)中噪声与无用视觉输入导致的性能下降问题。
  • 建模实体对、文本与视觉对象之间更细粒度的关联,以提升关系预测性能。
  • 开发一种方法,有效区分有助于预测的视觉内容与无关或具有误导性的视觉信号。
  • 通过基于提示的学习与结构化融合,提升低资源(少样本)场景下的性能。
  • 利用实体类型约束限制关系候选生成,以提升过滤效果与预测准确性。

提出的方法

  • 引入一种基于提示的自回归编码器,包含两种不同类型的前缀:面向实体的前缀与面向对象的前缀,用于建模模态内与模态间关联。
  • 采用双门控融合模块,包含局部对象重要性门与全局图像相关性门,根据视觉特征的相关性动态加权并融合视觉特征。
  • 设计一个生成式解码器,利用实体类型信息限制关系候选,以提升预测精度。
  • 应用联合目标,对齐融合前后表示分布,增强特征一致性与模型鲁棒性。
  • 利用前缀调优技术高效微调大语言模型,无需完整微调,支持少样本泛化。
  • 利用目标检测与图像特征中的视觉关系信息,以任务感知方式增强文本表示。

实验结果

研究问题

  • RQ1如何在多模态关系抽取中有效建模实体对、文本与视觉对象之间的深层关联?
  • RQ2双门控融合机制是否能有效提升对有用视觉特征的选择,同时抑制无用或具有误导性的特征?
  • RQ3前缀调优在低资源(少样本)关系抽取场景中能在多大程度上提升性能?
  • RQ4基于实体类型的解码机制如何改善关系候选的过滤与预测准确性?
  • RQ5通过前缀调优实现模态内与模态间关联的融合,是否能带来更好的泛化性与鲁棒性?

主要发现

  • DGF-PT 在基准 MNRE 数据集上达到当前最优性能,在全样本与少样本设置下均优于强基线模型。
  • 该模型在低资源场景下表现出优越的泛化能力,随着样本量减少,性能提升依然稳定。
  • 双门控融合机制能有效过滤无用视觉内容,降低噪声图像对预测的负面影响。
  • 案例研究证实,DGF-PT 能够正确识别不同实体对的相关视觉线索,即使使用同一张图像,也能根据实体对动态调整关注点。
  • 采用实体类型受限的解码机制显著提升了候选过滤效果,减少了对模糊关系的错误预测。
  • 随着视觉数据量增加,模型性能持续提升,表明其对视觉特征的利用效率优于基于前缀的基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。