Skip to main content
QUICK REVIEW

[论文解读] Text Prior Guided Scene Text Image Super-resolution

Jianqi Ma, Shi Guo|arXiv (Cornell University)|Jun 29, 2021
Advanced Image Processing Techniques被引用 15
一句话总结

本文提出文本先验引导超分辨率(TPGSR),一种多阶段框架,利用文本识别模型生成的字符概率序列作为类别先验,以提升场景文本图像的超分辨率效果。通过联合优化文本先验与重建的高分辨率图像,TPGSR在TextZoom基准上显著提升了视觉质量与文本识别准确率,优于当前最先进方法,并展现出对其他数据集甚至中文文本的强大泛化能力。

ABSTRACT

Scene text image super-resolution (STISR) aims to improve the resolution and visual quality of low-resolution (LR) scene text images, and consequently boost the performance of text recognition. However, most of existing STISR methods regard text images as natural scene images, ignoring the categorical information of text. In this paper, we make an inspiring attempt to embed categorical text prior into STISR model training. Specifically, we adopt the character probability sequence as the text prior, which can be obtained conveniently from a text recognition model. The text prior provides categorical guidance to recover high-resolution (HR) text images. On the other hand, the reconstructed HR image can refine the text prior in return. Finally, we present a multi-stage text prior guided super-resolution (TPGSR) framework for STISR. Our experiments on the benchmark TextZoom dataset show that TPGSR can not only effectively improve the visual quality of scene text images, but also significantly improve the text recognition accuracy over existing STISR methods. Our model trained on TextZoom also demonstrates certain generalization capability to the LR images in other datasets.

研究动机与目标

  • 解决现有STISR方法将文本图像视为自然场景图像、忽略其类别化文本信息的局限性。
  • 通过引入文本识别概率序列作为结构先验,提升低分辨率场景文本图像的视觉质量与可读性。
  • 构建一种联合学习框架,通过迭代优化使精炼后的文本先验与增强的高分辨率图像相互促进。
  • 证明所提方法在TextZoom基准之外的真实低分辨率图像上的泛化能力,包括多语言与长文本场景。

提出的方法

  • 该方法使用文本识别模型(如CRNN)为每张低分辨率场景文本图像生成字符概率序列作为文本先验(TP)。
  • 将此文本先验作为条件输入嵌入超分辨率网络,以引导高分辨率图像的重建。
  • 设计多阶段TPGSR框架,通过提出的TP损失实现端到端训练,迭代优化文本先验与超分辨率图像。
  • 通过重建的高分辨率图像微调文本先验生成器,以提升先验质量,实现图像与文本先验增强之间的反馈。
  • 在真实世界的TextZoom数据集上进行训练与评估,包含消融实验与当前最先进方法(如TSRN)的对比。
  • 为支持多语言扩展,在ICPR2018-MTWI数据集上训练多语言CRNN模型,以生成中文与英文字符的先验。

实验结果

研究问题

  • RQ1将文本识别概率序列作为类别先验,是否能显著提升场景文本图像的超分辨率效果?
  • RQ2重建的高分辨率图像与文本先验之间的相互优化,如何影响最终的SR质量与识别准确率?
  • RQ3所提出的TPGSR框架是否能泛化至其他数据集与语言的低分辨率图像,如中文或韩文?
  • RQ4该方法的失败模式是什么,特别是针对旋转、长序列或未登录词的文本实例?

主要发现

  • 在TextZoom基准上,TPGSR相比最先进方法TSRN在文本识别准确率上绝对提升1.6%,达到42.7%,而TSRN为41.1%。
  • 该方法显著提升了视觉质量与可读性,尤其在TSRN无法恢复可读字符的困难案例中表现更优。
  • 应用于中文文本时,TPGSR在高分辨率真实值上的识别准确率达到56.1%,高于TPGSR-TSRN的42.7%与TSRN的41.1%,较TSRN提升1.6%。
  • 模型在其他数据集上表现出强泛化能力,包括包含韩文、中文与孟加拉文的ICDAR-MLT数据集,其生成的图像轮廓更清晰,感知质量优于TSRN。
  • 失败案例包括在模糊输入上产生错误的文本先验引导、在旋转或多方向文本上性能下降,以及在极长文本序列中出现失真。
  • 该方法在象形文字(如中文)上展现出潜力,初步结果表明,即使在仅使用合成LR-HR配对进行训练的情况下,TPGSR也能比TSRN更好地恢复文本笔画。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。