Skip to main content
QUICK REVIEW

[论文解读] Accurate, Data-Efficient, Unconstrained Text Recognition with Convolutional Neural Networks

Mohamed Yousef, Khaled F. Hussain|arXiv (Cornell University)|Dec 31, 2018
Handwritten Text Recognition Techniques被引用 9
一句话总结

本文提出了一种简单、完全卷积、端到端的深度学习架构,用于通用的非约束文本识别,在无需循环连接的情况下,在七个基准数据集上实现了最先进性能。该模型采用深度可分离卷积、带有门控机制的新型层间残差连接,以及CTC损失,实现了高精度,同时对数据量和推理延迟要求极低。

ABSTRACT

Unconstrained text recognition is an important computer vision task, featuring a wide variety of different sub-tasks, each with its own set of challenges. One of the biggest promises of deep neural networks has been the convergence and automation of feature extractors from input raw signals, allowing for the highest possible performance with minimum required domain knowledge. To this end, we propose a data-efficient, end-to-end neural network model for generic, unconstrained text recognition. In our proposed architecture we strive for simplicity and efficiency without sacrificing recognition accuracy. Our proposed architecture is a fully convolutional network without any recurrent connections trained with the CTC loss function. Thus it operates on arbitrary input sizes and produces strings of arbitrary length in a very efficient and parallelizable manner. We show the generality and superiority of our proposed text recognition architecture by achieving state of the art results on seven public benchmark datasets, covering a wide spectrum of text recognition tasks, namely: Handwriting Recognition, CAPTCHA recognition, OCR, License Plate Recognition, and Scene Text Recognition. Our proposed architecture has won the ICFHR2018 Competition on Automated Text Recognition on a READ Dataset.

研究动机与目标

  • 开发一种通用、数据高效的神经网络架构,用于非约束文本识别,避免使用特定任务的模型。
  • 通过仅使用前馈卷积层和新型架构组件,消除文本识别中对循环网络的需求。
  • 通过新型归一化和门控机制提升模型效率与鲁棒性,同时保持高精度。
  • 在手写体、场景文本、CAPTCHA和车牌等多种文本识别任务中,验证该架构的通用性。
  • 建立一种统一、低超参数调优的解决方案,在多个基准上实现最先进性能。

提出的方法

  • 该模型是一种基于深度可分离卷积的完全卷积神经网络,以提升计算效率。
  • 引入具有可学习门控机制的新型层间残差连接,以稳定训练并改善梯度流动。
  • 通过层归一化和批量归一化进行归一化处理,门控模块前应用Softmax以稳定门控信号。
  • 采用连接时序分类(CTC)损失进行端到端训练,实现序列到字符串的映射。
  • 提出一组通用的数据增强技术,适用于所有文本识别任务,以提升鲁棒性和泛化能力。
  • 该架构可处理任意输入尺寸,并以完全并行化的方式生成可变长度输出。

实验结果

研究问题

  • RQ1无循环连接的完全卷积网络能否在非约束文本识别中实现最先进性能?
  • RQ2具有门控机制的层间残差连接如何提升文本识别模型的性能与训练稳定性?
  • RQ3不同归一化方案(层归一化、批量归一化)对模型收敛性和准确率有何影响?
  • RQ4单一统一架构能否在极少超参数调优下,跨多种文本识别任务实现最先进性能?
  • RQ5通用数据增强技术在提升模型在不同文本识别领域泛化能力方面的效果如何?

主要发现

  • 所提出的架构在七个公开基准数据集(包括IAM、KHATT、SVHN、UW3、AOLP和reCAPTCHA)上均实现了最先进性能。
  • 在reCAPTCHA数据集上,模型达到了人类水平表现,相较于之前的RCN系统,识别率绝对提升了20%。
  • 该模型在ICFHR2018的READ数据集竞赛中胜出,相较于第二名,字符错误率(CER)相对降低了超过25%。
  • 消融实验表明,若移除层归一化,CER将增加近30%,凸显其在模型稳定性中的关键作用。
  • 与基线模型相比,采用门控机制的残差连接使CER相对降低了20%。
  • 在IAM数据集上,仅使用约71k个参数的极小参数预算,模型即实现了22.85%的验证CER,展现出极高的数据效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。