Skip to main content
QUICK REVIEW

[论文解读] Reading Text in the Wild with Convolutional Neural Networks

Max Jaderberg, Karen Simonyan|arXiv (Cornell University)|Dec 4, 2014
Handwritten Text Recognition Techniques参考文献 20被引用 20
一句话总结

本文提出了一种基于卷积神经网络(CNN)和区域建议方法的端到端深度学习系统,用于自然场景图像中的文本检测。通过结合高召回率的区域建议与仅在合成数据上训练的CNN文本识别模型,该系统实现了最先进的性能,实现了无需人工标注真实世界数据的准确、可扩展的文本检测与识别。

ABSTRACT

In this work we present an end-to-end system for text spotting -- localising and recognising text in natural scene images -- and text based image retrieval. This system is based on a region proposal mechanism for detection and deep convolutional neural networks for recognition. Our pipeline uses a novel combination of complementary proposal generation techniques to ensure high recall, and a fast subsequent filtering stage for improving precision. For the recognition and ranking of proposals, we train very large convolutional neural networks to perform word recognition on the whole proposal region at the same time, departing from the character classifier based systems of the past. These networks are trained solely on data produced by a synthetic text generation engine, requiring no human labelled data. Analysing the stages of our pipeline, we show state-of-the-art performance throughout. We perform rigorous experiments across a number of standard end-to-end text spotting benchmarks and text-based image retrieval datasets, showing a large improvement over all previous methods. Finally, we demonstrate a real-world application of our text spotting system to allow thousands of hours of news footage to be instantly searchable via a text query.

研究动机与目标

  • 开发一种端到端的自然场景图像文本检测系统,将检测与识别整合到单一处理流程中。
  • 提升在字体、光照和方向变化极大的非约束环境下文本识别的准确性。
  • 通过仅在合成数据上训练识别模型,消除对人工标注训练数据的需求。
  • 实现在大规模视频语料库中可扩展的实时基于文本的图像检索。
  • 通过多阶段过滤与优化,在保持高精度的同时实现高召回率的检测。

提出的方法

  • 结合基于边缘的区域建议(Edge Boxes)与滑动窗口检测器,生成高召回率的单词边界框建议。
  • 采用随机森林分类器过滤误报,减少建议数量的同时保留真实正例。
  • 应用CNN进行边界框回归,优化剩余建议的坐标,提升定位精度。
  • 使用大规模CNN对整个建议区域执行端到端的单词识别,从90,000个单词词典中进行分类。
  • 仅使用文本渲染引擎生成的合成文本数据训练识别CNN,避免人工标注。
  • 采用增量学习策略以应对识别任务中大量类别的挑战。

实验结果

研究问题

  • RQ1仅在合成数据上训练的深度CNN识别模型是否能在真实世界场景文本识别任务上超越现有系统?
  • RQ2结合区域建议与过滤的多阶段检测流水线是否能实现高于以往检测方法的召回率?
  • RQ3将检测与识别整合到端到端系统中,是否能显著提升文本检测与图像检索基准的表现?
  • RQ4在无真实世界标注的情况下,合成数据训练在多大程度上能泛化到真实世界文本识别任务?
  • RQ5该系统是否能扩展至大规模视频语料库,实现实时基于文本的图像检索?

主要发现

  • 在SVT文本检索基准上,系统达到86.3%的平均精度均值(mAP),显著优于先前方法。
  • 在ICDAR 2003和Street View Text数据集上,检测阶段的单词召回率约为98%,超过以往方法。
  • 仅在合成数据上训练的识别模型在真实世界场景文本识别任务中达到最先进准确率,且未使用任何真实世界标注数据。
  • 该流水线在单个CPU核心和GPU上每张图像处理时间为5–20秒,高端硬件上可扩展至每秒1–2张图像。
  • 在真实世界应用中,系统在5,000小时BBC新闻视频语料库上对'hollywood'和'boris johnson'等查询实现了100%的精确率在前100名(P@100)。
  • SVT和Sports数据集等测试集中存在的标注不完整,人为降低了报告的mAP,表明实际性能高于报告值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。