Skip to main content
QUICK REVIEW

[论文解读] On Analyzing the Role of Image for Visual-enhanced Relation Extraction

Lei Li, Xiang Chen|arXiv (Cornell University)|Nov 14, 2022
Multimodal Machine Learning Applications被引用 5
一句话总结

本文提出 IFAformer,一种用于视觉增强关系抽取的强基准模型,通过基于 Transformer 的双流架构实现隐式、细粒度的多模态对齐。结合原始图像和检测到的视觉对象与文本信息,该模型在 MNRE 数据集上实现了 92.38% 的准确率和 81.67% 的 F1 分数,显著优于当前最先进方法(如 MEGA),并表明只有在正确对齐的情况下,视觉信息才能被有效利用。

ABSTRACT

Multimodal relation extraction is an essential task for knowledge graph construction. In this paper, we take an in-depth empirical analysis that indicates the inaccurate information in the visual scene graph leads to poor modal alignment weights, further degrading performance. Moreover, the visual shuffle experiments illustrate that the current approaches may not take full advantage of visual information. Based on the above observation, we further propose a strong baseline with an implicit fine-grained multimodal alignment based on Transformer for multimodal relation extraction. Experimental results demonstrate the better performance of our method. Codes are available at https://github.com/zjunlp/DeepKE/tree/main/example/re/multimodal.

研究动机与目标

  • 探究当前视觉增强关系抽取(MRE)方法在利用准确视觉信息方面的局限性。
  • 识别出不准确的视觉场景图和粗粒度对齐会降低模型性能。
  • 提出一种鲁棒基线 IFAformer,通过隐式、细粒度的跨模态注意力机制改进多模态对齐。
  • 验证只有当视觉信息与文本实体正确对齐时,其才真正有益。

提出的方法

  • 使用双流 Transformer 编码器分别处理原始图像和文本,视觉特征来自目标检测和视觉定位。
  • 在每一层中应用多头注意力机制,通过视觉与文本表示之间的交叉注意力实现隐式、细粒度对齐。
  • 使用可学习的投影矩阵将文本和视觉编码器的隐藏状态映射为查询(query)、键(key)和值(value)向量。
  • 执行交叉注意力机制,使视觉查询同时关注视觉和文本的键与值,反之亦然,从而实现联合表征学习。
  • 使用最终的文本表示进行关系分类,支持端到端训练。
  • 引入细粒度视觉对象作为额外输入,以提升对齐精度。

实验结果

研究问题

  • RQ1为何当前 MRE 性能在使用视觉输入后趋于饱和?
  • RQ2不准确的视觉场景图在多大程度上干扰了有效的视觉-文本对齐?
  • RQ3若避免显式依赖场景图,模型能否实现更优性能?
  • RQ4细粒度视觉对象检测对提升 MRE 性能有多关键?
  • RQ5该模型是否真正依赖视觉信息,还是仅学习了虚假相关性?

主要发现

  • MEGA 模型在图像-文本对被打乱后仍保持稳定性能,表明其可能未有效利用视觉引导。
  • 视觉场景图常包含误导性或重复的对象(如“man”、“shirt”、“wire”),导致错误的对齐权重。
  • IFAformer 在 MNRE 上实现 92.38% 的准确率和 81.67% 的 F1 分数,F1 分数相比 MEGA 提升 15.26%。
  • 在训练过程中打乱图像-文本对时,IFAformer 的准确率下降至 74.23%,证实其对正确视觉输入的依赖性。
  • 在视觉编码器中移除文本注意力会降低性能,表明多模态融合至关重要。
  • 与原始 IFAformer 相比,引入细粒度视觉对象可使性能提升 4.63%,凸显其重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。