Skip to main content
QUICK REVIEW

[论文解读] Doc-GCN: Heterogeneous Graph Convolutional Networks for Document Layout Analysis

Siwen Luo, Yihao Ding|UWA Profiles and Research Repository (UWA)|Aug 22, 2022
Handwritten Text Recognition Techniques被引用 7
一句话总结

Doc-GCN 提出了一种异构图卷积网络,通过整合文档布局组件的四种不同方面——句法、语义、文本密度和视觉外观——来提升布局分类性能。通过为每种特征类型构建独立的图,并应用带有节点级池化的图卷积,该方法捕捉了组件间的相互关系,在 PubLayNet、FUNSD 和 DocBank 数据集上实现了最先进(SOTA)的性能表现。

ABSTRACT

Recognizing the layout of unstructured digital documents is crucial when parsing the documents into the structured, machine-readable format for downstream applications. Recent studies in Document Layout Analysis usually rely on computer vision models to understand documents while ignoring other information, such as context information or relation of document components, which are vital to capture. Our Doc-GCN presents an effective way to harmonize and integrate heterogeneous aspects for Document Layout Analysis. We first construct graphs to explicitly describe four main aspects, including syntactic, semantic, density, and appearance/visual information. Then, we apply graph convolutional networks for representing each aspect of information and use pooling to integrate them. Finally, we aggregate each aspect and feed them into 2-layer MLPs for document layout component classification. Our Doc-GCN achieves new state-of-the-art results in three widely used DLA datasets.

研究动机与目标

  • 为解决现有 DLA 模型仅依赖视觉或文本特征的局限性,通过整合布局组件的多种异构特征方面。
  • 通过基于图的表示方法,建模文档布局组件之间的结构化与关系依赖。
  • 通过图卷积与池化机制,协调多样化特征类型,提升文档组件分类的准确性。
  • 证明在语义和视觉特征基础上,整合句法与密度特征可显著提升布局分析性能。

提出的方法

  • 使用不同的节点初始化方法,构建六个独立的图——每类特征(句法、语义、密度、外观)各两个。
  • 在每个图中应用图卷积网络(GCN),通过聚合邻近节点的特征来更新节点嵌入。
  • 使用节点级池化(具体为最大池化)聚合每类特征的图级表示。
  • 将所有四类特征方面经过池化后的表示拼接,形成每个布局组件的统一特征向量。
  • 将最终的特征向量输入一个两层多层感知机(MLP),对预定义的布局类别进行分类。
  • 在文档页面级别的数据上端到端训练模型,通过布局组件分类的交叉熵损失进行优化。

实验结果

研究问题

  • RQ1如何有效整合句法、语义、密度和外观等多种异构特征,以提升文档布局分析性能?
  • RQ2通过图结构建模组件间关系,对布局分类准确率有何影响?
  • RQ3哪类特征方面与池化策略的组合能在文档布局分类中取得最佳性能?
  • RQ4基于图的方法是否能超越仅依赖视觉或文本特征的现有模型?

主要发现

  • Doc-GCN 在 PubLayNet 上取得了 98.63% 的 SOTA F1 分数,在 FUNSD 上为 85.49%,在 DocBank 上为 91.83%,全面超越所有基线模型。
  • 引入句法与密度特征在所有三个数据集上均提升了性能,其中在 FUNSD 上提升最为显著(相比基线 F1 提升 6.62%)。
  • 最大池化在所有数据集上表现最佳,尤其在 FUNSD 上,相比平均池化和最小池化,F1 提升近 3%。
  • 该模型展现出优越的泛化能力,能正确分类 RoBERTa 和 Faster R-CNN 失败的挑战性组件(如 'List' 和 'Text')。
  • 大规模预训练(如 Doc-GCN-L)进一步提升了性能,在所有三个数据集上均优于 BERT-L、RoBERTa-L 和 LayoutLM-L。
  • 消融实验确认,四类特征方面均对性能有正向贡献,其中语义与外观特征影响最强,而句法与密度特征提供了关键的互补性提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。