Skip to main content
QUICK REVIEW

[论文解读] Generative Shape Models: Joint Text Recognition and Segmentation with Very Little Training Data

Xinghua Lou, Ken Kansky|arXiv (Cornell University)|Nov 8, 2016
Handwritten Text Recognition Techniques参考文献 18被引用 6
一句话总结

本文提出了一种生成式形状模型,仅使用数百张训练图像即可实现最先进的场景文本识别与细粒度字符分割效果,远少于判别式模型所需的数量级。通过在侧向约束中编码不变性,并采用贪心字体选择方法,该模型能稳健地泛化至仿射与非仿射形变,尽管监督信号极少,仍优于深度学习基线模型。

ABSTRACT

We demonstrate that a generative model for object shapes can achieve state of the art results on challenging scene text recognition tasks, and with orders of magnitude fewer training images than required for competing discriminative methods. In addition to transcribing text from challenging images, our method performs fine-grained instance segmentation of characters. We show that our model is more robust to both affine transformations and non-affine deformations compared to previous approaches.

研究动机与目标

  • 解决真实图像中字体、形变与图像质量高度多变的场景文本识别挑战。
  • 通过开发一种能从少量训练样本中良好泛化的生成式模型,减少对大规模标注数据集的依赖。
  • 在不显式进行检测步骤的前提下,联合实现精确的字符分割与词句解析。
  • 通过显式编码的形状不变性,提升对仿射与非仿射形变的鲁棒性。
  • 证明在数据稀缺时,具有结构化先验的生成建模可超越深度判别式模型。

提出的方法

  • 在干净、无杂乱的字符图像上训练生成式形状模型,利用短程与长程侧向约束学习全局形状结构。
  • 侧向约束通过在指定半径内允许受控扰动,编码对形变的不变性,提升对形变的鲁棒性。
  • 采用贪心字体选择算法从大型数据库中提取代表性字体,以应对真实场景中强烈的字体差异。
  • 基于结构化输出学习的词句解析器,利用字符级特征(如尺寸、位置、颜色、n-gram)与语言模型重建词语。
  • 模型在推理阶段执行反向追踪以优化分割边界,不同于标准判别式模型仅进行前向传播。
  • 解析特征包括形状先验、空间距离、高度与y轴偏移差、颜色相似性及n-gram概率,所有特征均经过归一化与对数变换。

实验结果

研究问题

  • RQ1生成式形状模型是否能在远少于判别式模型所需训练数据的情况下,实现场景文本识别的SOTA性能?
  • RQ2通过侧向约束显式编码不变性,在处理仿射与非仿射形变时效果如何?
  • RQ3与基于检测的方法相比,生成式模型在产生精确分割边界方面,对解析性能的提升程度如何?
  • RQ4当禁用语言模型时,该系统与CNN等判别式模型相比性能表现如何?
  • RQ5在模型结构中直接编码不变性时,非分层生成式模型是否能超越深层分层判别式模型?

主要发现

  • 该模型仅使用数百张训练图像,就在ICDAR 2013与SVT数据集上达到SOTA性能,远少于判别式模型通常所需的数百万张图像。
  • 当语言模型被禁用时,系统性能下降约15%,而PhotoOCR下降达40%,表明本模型因分割更优而具备更强鲁棒性。
  • 由于显式编码了侧向约束,该模型在仿射变换与非仿射形变上均表现出强大泛化能力。
  • 与CNN和DPM等判别式模型不同,该生成式模型无需额外后处理即可生成精确的分割边界。
  • 在干净图像上,该系统优于PhotoOCR,而PhotoOCR常在此类图像上失效,凸显了精确分割的优势。
  • 在低数据场景下,结合结构化先验与不变性编码的生成式方法超越了深度判别式模型,证明归纳偏置可超越数据规模的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。