Skip to main content
QUICK REVIEW

[论文解读] Deep Neural Network for Semantic-based Text Recognition in Images

Yi Zheng, Qitong Wang|arXiv (Cornell University)|Aug 4, 2019
Handwritten Text Recognition Techniques参考文献 31被引用 5
一句话总结

本文提出了一种基于语义的文本识别(STR)模型,通过使用文本分组与排列(TGA)算法对孤立文本区域进行分组和排序,并利用具有双向LSTM的序列到序列模型进行预测校正,从而提升图像中的文本识别性能。该STR模型在扫描的目录图像上达到90%的准确率,在具有挑战性的抗议标语图像上达到71%的准确率,通过超越孤立单词识别的上下文理解,展现出更强的鲁棒性。

ABSTRACT

State-of-the-art text spotting systems typically aim to detect isolated words or word-by-word text in images of natural scenes and ignore the semantic coherence within a region of text. However, when interpreted together, seemingly isolated words may be easier to recognize. On this basis, we propose a novel "semantic-based text recognition" (STR) deep learning model that reads text in images with the help of understanding context. STR consists of several modules. We introduce the Text Grouping and Arranging (TGA) algorithm to connect and order isolated text regions. A text-recognition network interprets isolated words. Benefiting from semantic information, a sequenceto-sequence network model efficiently corrects inaccurate and uncertain phrases produced earlier in the STR pipeline. We present experiments on two new distinct datasets that contain scanned catalog images of interior designs and photographs of protesters with hand-written signs, respectively. Our results show that our STR model outperforms a baseline method that uses state-of-the-art single-wordrecognition techniques on both datasets. STR yields a high accuracy rate of 90% on the catalog images and 71% on the more difficult protest images, suggesting its generality in recognizing text.

研究动机与目标

  • 解决当前最先进文本检测系统将单词孤立处理、忽略文本区域内语义连贯性的问题。
  • 通过利用分组短语和句子中的上下文与语义信息,提升文本识别的准确性。
  • 开发一种新颖的版面分析算法(TGA),将文本区域分组并排序为连贯的短语或段落。
  • 创建两个新的公开可用数据集,包含多词短语和段落的标注分组,用于训练和评估。
  • 证明语义上下文在多种真实世界图像领域中提升文本识别性能的通用性与有效性。

提出的方法

  • TGA算法通过分析空间接近度、对齐方式和视觉相似性,对孤立文本区域进行分组与排序,形成连贯的短语或段落。
  • 基于深度学习的文本识别网络处理单个单词并生成初始预测结果。
  • 具有双向LSTM的序列到序列模型编码预测单词序列中的上下文信息,以校正拼写和词汇选择错误。
  • 序列到序列模型将预测的单词序列作为输入,将校正后的序列作为输出,实现基于上下文的拼写校正。
  • 该模型整合了多层次信息——空间分组与语义上下文——而非仅依赖图像特征,从而提升识别性能。
  • 该框架在两个新数据集上进行训练与评估:IDD(扫描的室内设计目录)和TPID(包含手写文本的抗议标语照片)。

实验结果

研究问题

  • RQ1将孤立文本区域分组并排序为连贯短语是否能提升图像中的文本识别准确率?
  • RQ2具有双向LSTM的序列到序列模型在利用语义上下文校正单词识别错误方面效果如何?
  • RQ3在具有不规则文本布局的具有挑战性的现实世界图像中,引入语义上下文是否能显著提升识别性能?
  • RQ4该模型在不同语义上下文(如印刷目录与手写抗议标语)之间具有多大程度的泛化能力?
  • RQ5像TGA这样的版面分析算法能否在复杂场景中可靠地识别并排序属于同一短语或段落的文本区域?

主要发现

  • STR模型在扫描的室内设计目录数据集(IDD)上达到90%的识别准确率,显著优于基线的单字识别方法。
  • 在更具挑战性的抗议图像数据集(TPID)上,STR达到71%的准确率,表明其对几何失真、不规则字体和非水平文本布局具有鲁棒性。
  • TGA算法在90%的IDD图像中成功完成文本区域的分组与排列,且在单个清晰书写的抗议标语上表现可靠,但在重叠或旋转的文本区域上表现不佳。
  • 序列到序列校正模型能有效校正诸如误识别单词(如将'SILLS'更正为'SPILLS')和缺失单词(如句子中缺少'a')等错误,提升文本的流畅性与正确性。
  • 通过利用语义上下文,该模型降低了错误率,证明了上下文信息在孤立单词分析之外显著提升了识别性能。
  • 所提出的IDD和TPID数据集,包含真实标注的短语与段落,现已公开,为基于语义的文本识别提供了全新的基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。