Skip to main content
QUICK REVIEW

[论文解读] OrigamiNet: Weakly-Supervised, Segmentation-Free, One-Step, Full Page Text Recognition by learning to unfold

Mohamed Yousef, Tom E. Bishop|arXiv (Cornell University)|Jun 12, 2020
Handwritten Text Recognition Techniques参考文献 28被引用 9
一句话总结

OrigamiNet 提出了一种新颖的、弱监督的、无需分割的、一步完成的神经网络模块,通过学习将二维文本布局隐式展开为一维序列,使任何全卷积的单行文本识别器都能实现整页文本识别。该方法仅使用未分割的图像-文本对和一次前向传播,就在 IAM 和 ICDAR 2017 基准测试中实现了最先进(SOTA)的字符错误率(CER)。

ABSTRACT

Text recognition is a major computer vision task with a big set of associated challenges. One of those traditional challenges is the coupled nature of text recognition and segmentation. This problem has been progressively solved over the past decades, going from segmentation based recognition to segmentation free approaches, which proved more accurate and much cheaper to annotate data for. We take a step from segmentation-free single line recognition towards segmentation-free multi-line / full page recognition. We propose a novel and simple neural network module, termed extbf{OrigamiNet}, that can augment any CTC-trained, fully convolutional single line text recognizer, to convert it into a multi-line version by providing the model with enough spatial capacity to be able to properly collapse a 2D input signal into 1D without losing information. Such modified networks can be trained using exactly their same simple original procedure, and using only extbf{unsegmented} image and text pairs. We carry out a set of interpretability experiments that show that our trained models learn an accurate implicit line segmentation. We achieve state-of-the-art character error rate on both IAM \& ICDAR 2017 HTR benchmarks for handwriting recognition, surpassing all other methods in the literature. On IAM we even surpass single line methods that use accurate localization information during training. Our code is available online at \url{https://github.com/IntuitionMachines/OrigamiNet}.

研究动机与目标

  • 消除整页手写文本识别中对显式文本行分割的需求。
  • 仅使用未分割的图像-文本对,实现多行文本识别器的端到端训练。
  • 开发一种简单、即插即用的模块,将任何基于 CTC 的单行识别器转换为整页识别器。
  • 证明模型可以在无任何定位监督的情况下,隐式学习准确的行分割。
  • 在无需行级标注或复杂训练策略的情况下,实现在整页手写识别基准上的最先进性能。

提出的方法

  • 该方法提出 OrigamiNet,一种神经网络子模块,通过应用空间瓶颈层并随后进行上采样,将二维输入特征转换为一维序列表示。
  • 它利用 CTC 损失函数,该函数天然地鼓励线性的一维对齐,以引导模型学习将二维空间排列压缩为一维字符序列。
  • 该模块被添加到现有的全卷积单行文本识别器中,使其能够在一次前向传播中处理整页图像。
  • 模型仅使用未分割的图像和文本对进行训练,无需真实行边界或词级标注。
  • 该方法仅依赖前馈连接,避免使用循环层,从而实现高效的一步推理。
  • 通过基于梯度的显著性图评估可解释性,可视化每个字符输出与输入图像中空间区域的关联。

实验结果

研究问题

  • RQ1神经网络是否能在无行边界监督的情况下,隐式地将多行文本布局分割为单个行?
  • RQ2一次统一的网络前向传播能否实现超越使用显式行分割方法的整页文本识别性能?
  • RQ3在弱监督、未分割数据上训练时,基于 CTC 的架构若增加空间展开模块,其准确率是否保持或提升?
  • RQ4该模型能否在无需微调的情况下泛化到具有扭曲、接触或旋转文本行的复杂文档布局?
  • RQ5即使在无监督的情况下,模型所学习的隐式行分割是否具有可解释性且空间上准确?

主要发现

  • 在 IAM 数据集上,OrigamiNet 在 750×750 输入分辨率下实现了 5.5% 的最先进字符错误率(CER),优于使用行级标注的先前方法。
  • 在 ICDAR 2017 HTR 基准测试中,GTR-12 OrigamiNet 模型实现了 4.7% 的 CER,超越了所有先前方法,包括使用完整行断点标注的方法。
  • 在 IAM 数据集上,使用 500×500 输入分辨率时,模型实现了 5.6% 的 CER,表明其在低分辨率下仍具有强大性能。
  • 可解释性实验表明,梯度显著性图能清晰地将字符定位到其对应的行,表明模型学习到了准确的隐式行分割。
  • 该模型在合成扭曲(如接触行和扭曲文本)情况下表现出良好的泛化能力,且无需微调即可保持稳健性能。
  • 当在水平翻转的图像和转录文本上进行训练时,模型性能表现相当,证实了模型是从数据中学习阅读顺序,而非依赖空间偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。