Skip to main content
QUICK REVIEW

[论文解读] DEER: Detection-agnostic End-to-End Recognizer for Scene Text Spotting

Seonghyun Kim, Seung Yong Shin|arXiv (Cornell University)|Mar 10, 2022
Handwritten Text Recognition Techniques被引用 6
一句话总结

DEER 提出了一种面向场景文本检测与识别的、与检测无关的端到端识别器,通过为每个文本实例使用单个参考点替代基于区域的特征提取,实现了利用全图特征进行鲁棒识别。该方法在无需边界框或多边形标注的情况下,于任意形状文本基准上取得了具有竞争力的性能,展现出对检测错误的强鲁棒性。

ABSTRACT

Recent end-to-end scene text spotters have achieved great improvement in recognizing arbitrary-shaped text instances. Common approaches for text spotting use region of interest pooling or segmentation masks to restrict features to single text instances. However, this makes it hard for the recognizer to decode correct sequences when the detection is not accurate i.e. one or more characters are cropped out. Considering that it is hard to accurately decide word boundaries with only the detector, we propose a novel Detection-agnostic End-to-End Recognizer, DEER, framework. The proposed method reduces the tight dependency between detection and recognition modules by bridging them with a single reference point for each text instance, instead of using detected regions. The proposed method allows the decoder to recognize the texts that are indicated by the reference point, with features from the whole image. Since only a single point is required to recognize the text, the proposed method enables text spotting without an arbitrarily-shaped detector or bounding polygon annotations. Experimental results present that the proposed method achieves competitive results on regular and arbitrarily-shaped text spotting benchmarks. Further analysis shows that DEER is robust to the detection errors. The code and dataset will be publicly available.

研究动机与目标

  • 通过将特征提取与特定区域的池化解耦,减少端到端场景文本识别中检测与识别之间的强耦合。
  • 实现在不依赖精确边界多边形或分割掩码的前提下,对任意形状、旋转或弯曲文本的识别。
  • 仅使用参考点标注进行端到端模型训练,消除对昂贵多边形级别监督的需求。
  • 通过允许识别器从单个参考点关注整个图像的特征,提升对检测错误的鲁棒性。
  • 探索在极小监督下实现高性能文本检测与识别的可行性,重点采用点级标注而非区域级标注。

提出的方法

  • 模型为每个文本实例使用检测器生成的单个参考点,引导解码器在全图范围内关注相关特征。
  • 可学习的位置头在推理时预测参考点,文本解码器通过交叉注意力机制关注以这些点为中心的图像特征。
  • 解码器关注全局图像特征而非裁剪的图像块,即使检测不准确或文本呈曲线形态,也能实现识别。
  • 训练过程中采用参考点扰动策略,以提升对噪声或不精确检测输出的鲁棒性。
  • 提出一种替代的参考点采样方法(Inner 方法):训练时使用多边形内部的随机点,推理时使用中心截面的中点。
  • 模型在训练中使用检测监督以指导特征学习,但在推理时仅依赖点监督即可运行。

实验结果

研究问题

  • RQ1是否可以实现不依赖边界框或多边形等区域级标注的端到端文本检测与识别?
  • RQ2当检测不准确时,文本识别器的性能会如何退化?是否可通过改变特征提取范式加以缓解?
  • RQ3当识别器仅从单个参考点关注全局图像特征而非局部区域时,其泛化能力能达到何种程度?
  • RQ4当检测器仅提供一个参考点时,与检测无关的识别器能否在弯曲或不规则形状文本上保持高精度?
  • RQ5使用噪声或扰动的参考点进行训练,是否能提升模型对检测错误的鲁棒性?

主要发现

  • DEER 在包括 TotalText 和 ICDAR2015 在内的常规与任意形状文本检测与识别基准上均取得了具有竞争力的性能,且无需多边形标注或区域池化。
  • 模型对检测错误表现出强鲁棒性:即使使用不准确检测生成的参考点,DEER 仍能正确识别文本,与基于分割的模型相比在定性结果中表现优异。
  • 训练过程中对参考点的扰动显著提升了鲁棒性,有效缓解了在噪声检测输入下的性能下降。
  • 参考点采样中的 Inner 方法性能与标准方法相当,表明参考点无需位于文本区域内即可实现有效识别。
  • 训练中使用检测监督可提升识别性能,但即使无此监督,模型仍表现良好,表明仅依赖点级监督即可实现高精度。
  • 在模糊情形下,模型表现出结构化的错误模式(如在红色背景上预测 'SALE',或在 'SALE' 后预测 'OFF'),提示全局上下文可能导致偏差放大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。