[论文解读] A Text Attention Network for Spatial Deformation Robust Scene Text Image Super-resolution
本文提出TATT,一种用于场景文本图像超分的CNN-Transformer混合网络,通过全局注意力机制利用文本语义信息,提升对空间形变文本(如旋转或曲线形状)的重建效果,在PSNR、SSIM及下游文本识别准确率方面达到当前最优性能,尤其在具有挑战性的形变场景下表现突出。
Scene text image super-resolution aims to increase the resolution and readability of the text in low-resolution images. Though significant improvement has been achieved by deep convolutional neural networks (CNNs), it remains difficult to reconstruct high-resolution images for spatially deformed texts, especially rotated and curve-shaped ones. This is because the current CNN-based methods adopt locality-based operations, which are not effective to deal with the variation caused by deformations. In this paper, we propose a CNN based Text ATTention network (TATT) to address this problem. The semantics of the text are firstly extracted by a text recognition module as text prior information. Then we design a novel transformer-based module, which leverages global attention mechanism, to exert the semantic guidance of text prior to the text reconstruction process. In addition, we propose a text structure consistency loss to refine the visual appearance by imposing structural consistency on the reconstructions of regular and deformed texts. Experiments on the benchmark TextZoom dataset show that the proposed TATT not only achieves state-of-the-art performance in terms of PSNR/SSIM metrics, but also significantly improves the recognition accuracy in the downstream text recognition task, particularly for text instances with multi-orientation and curved shapes. Code is available at https://github.com/mjq11302010044/TATT.
研究动机与目标
- 解决超分空间形变场景文本图像的挑战,特别是旋转和曲线文本,因现有CNN方法受局部归纳偏置影响而难以处理。
- 通过引入全局注意力机制,克服现有方法中局部特征操作的局限性,使语义先验与视觉特征在形变下实现更好对齐。
- 通过引入一种新颖的文本结构一致性损失,强制规范文本与形变文本重建结果之间的结构相似性,从而提升文本重建质量与下游识别性能。
- 在TextZoom基准上实现当前最优结果,同时保持实时推理速度,证明其在真实世界低质量、形变文本图像数据集上具有强大的泛化能力。
提出的方法
- 使用文本识别模型从低分辨率场景文本图像中提取语义先验(文本先验,TP),作为高层指导信号。
- 设计基于文本先验与图像特征之间交叉注意力机制的TP解释器模块,实现全局、长距离的特征交互。
- 将TP解释器模块集成到单阶段超分网络中,通过语义一致性引导高分辨率图像生成。
- 提出一种文本结构一致性(TSC)损失,最小化重建后的规范文本与形变文本图像之间的结构差异,提升视觉保真度。
- 采用感知损失、对抗性损失与TSC损失的组合进行端到端训练,以优化图像质量和结构真实性。
- 采用轻量化、高效的网络架构,在保持高推理速度(960 fps)的同时,提升对形变的鲁棒性,与SOTA方法相当。
实验结果
研究问题
- RQ1与局部卷积操作相比,全局注意力机制是否能有效提升空间形变场景文本图像的重建效果?
- RQ2通过基于Transformer的模块引入语义文本先验,是否能提升超分后文本图像的视觉质量与结构准确性?
- RQ3所提出的文本结构一致性损失在恢复曲线与旋转文本方面,相较于基线方法能提升多少?
- RQ4在图像质量与下游文本识别准确率方面,是否单阶段模型结合语义引导能超越多阶段方法?
- RQ5所提出方法在外部数据集(如ICDAR15、CUTE80、SVTP)的真实世界低质量文本图像上,泛化能力如何?
主要发现
- TATT在TextZoom基准上实现当前最优PSNR(21.52)与SSIM(0.7930),优于现有方法,包括多阶段模型。
- 在SR输出上使用ASTER与CRNN进行文本识别,TATT取得最高识别准确率,甚至超越三阶段的TPGSR-3模型,且仅采用单阶段架构。
- 在人工筛选的旋转与曲线文本样本上,TATT相较于TPGSR与TBSRN展现出显著更大的性能差距,表明其对形变具有更强的鲁棒性。
- TSC损失能有效提升视觉质量与字符结构的精细化程度,尤其在形变文本情况下,定性对比结果清晰显示其优势。
- TATT在真实世界数据集(ICDAR15、CUTE80、SVTP)上泛化良好,在低分辨率、退化图像上测试时,对所有退化类型均取得最高识别准确率。
- 模型保持了高推理速度(960 fps),与TPGSR和TBSRN相当,证明其在实现SOTA性能的同时具备实际效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。