Skip to main content
QUICK REVIEW

[论文解读] MatchVIE: Exploiting Match Relevancy between Entities for Visual Information Extraction

Guozhi Tang, Lele Xie|arXiv (Cornell University)|Jun 24, 2021
Advanced Image and Video Retrieval Techniques参考文献 22被引用 4
一句话总结

本文提出 MatchVIE,一种新颖的视觉信息抽取模型,通过基于实体相关性的键值匹配来提升文档图像理解的准确性。通过使用图神经网络建模键与值之间的强语义和空间关系,并引入 Num2Vec 实现稳定的值编码,MatchVIE 在数值型和模糊实体上实现了最先进性能,尤其在 EPHOIE 数据集上相比先前方法最高提升 3.66% 的 F1 分数。

ABSTRACT

Visual Information Extraction (VIE) task aims to extract key information from multifarious document images (e.g., invoices and purchase receipts). Most previous methods treat the VIE task simply as a sequence labeling problem or classification problem, which requires models to carefully identify each kind of semantics by introducing multimodal features, such as font, color, layout. But simply introducing multimodal features couldn't work well when faced with numeric semantic categories or some ambiguous texts. To address this issue, in this paper we propose a novel key-value matching model based on a graph neural network for VIE (MatchVIE). Through key-value matching based on relevancy evaluation, the proposed MatchVIE can bypass the recognitions to various semantics, and simply focuses on the strong relevancy between entities. Besides, we introduce a simple but effective operation, Num2Vec, to tackle the instability of encoded values, which helps model converge more smoothly. Comprehensive experiments demonstrate that the proposed MatchVIE can significantly outperform previous methods. Notably, to the best of our knowledge, MatchVIE may be the first attempt to tackle the VIE task by modeling the relevancy between keys and values and it is a good complement to the existing methods.

研究动机与目标

  • 解决序列标注和基于分类的 VIE 方法在处理模糊或数值语义类别时的局限性。
  • 通过显式建模文档布局中键与值之间的相关性,提升视觉信息抽取性能。
  • 通过利用文档布局中的结构和空间线索,减少对细粒度语义识别的依赖。
  • 通过一种新型值编码技术 Num2Vec 提升模型稳定性和收敛性。
  • 通过将键值匹配视为核心学习目标,为 VIE 提供一种新视角。

提出的方法

  • MatchVIE 采用双分支架构:一个用于使用图神经网络(GNN)进行键值相关性评估,另一个用于独立的文本序列标注。
  • 相关性评估分支在图上使用多头自注意力机制,其中节点代表实体,边代表空间或语义接近性。
  • 提出一种名为 Num2Vec 的新型操作,将数值型值嵌入为稠密向量,降低训练过程中的不稳定性并提升收敛性。
  • 通过 GNN 整合视觉、布局和语义特征,捕捉文档图像中实体之间的长距离依赖关系。
  • 键值匹配机制使模型能够基于强上下文关系推断实体类别,而非直接依赖语义分类。
  • 该架构通过在实体分类和匹配预测上使用交叉熵损失进行端到端训练。

实验结果

研究问题

  • RQ1与传统的序列标注或分类方法相比,建模文档图像中的键值相关性是否能提升视觉信息抽取的准确性?
  • RQ2在模糊或数值型实体类别上,引入实体之间的布局和空间关系如何影响性能?
  • RQ3Num2Vec 编码技术在多大程度上稳定了训练并提升了值表示的收敛性?
  • RQ4基于图的方法若聚焦于实体关系,是否能优于仅依赖多模态特征融合的方法?
  • RQ5键值匹配是否是视觉信息抽取中直接语义分类的可行且有效的替代方案?

主要发现

  • 在 SROIE 数据集上,MatchVIE 达到 96.57% 的 F1 分数,相比之前最先进方法(TRIE)提升 0.39 个百分点。
  • 在 EPHOIE 数据集上,MatchVIE 达到 96.87% 的 F1 分数,超过 SOTA 方法(TRIE)3.66 个百分点,尤其在数值型和模糊类别上表现优异。
  • 在 FUNSD 数据集上,相比之前 SOTA 方法,F1 分数提升 2.06 个百分点,表明其在多样化布局上的强大泛化能力。
  • 消融实验表明,在相关性分支中使用两层和多头注意力可获得最佳性能,超过三层后收益递减。
  • Num2Vec 操作显著提升了训练稳定性和收敛速度,表现为更平滑的训练曲线和更好的泛化能力。
  • 键值匹配机制降低了对细粒度语义识别的需求,尤其对相似或数值型实体(如 'Expiry Date' 和 'Issue Date')具有显著优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。