Skip to main content
QUICK REVIEW

[论文解读] Multilingual Scene Character Recognition System using Sparse Auto-Encoder for Efficient Local Features Representation in Bag of Features

Maroua Tounsi, Ikram Moalla|arXiv (Cornell University)|Jun 11, 2018
Handwritten Text Recognition Techniques参考文献 20被引用 3
一句话总结

本文提出了一种多语言场景文字识别系统,通过使用深度稀疏自编码器(SAE)增强袋模型(BoF)表示,以提升局部特征编码效果。通过利用SAE从局部图像块中学习高效且具有判别性的特征,该方法在五个语言的场景下均实现了更高的识别准确率,优于多种基准数据集上的传统BoF方法。

ABSTRACT

The recognition of texts existing in camera-captured images has become an important issue for a great deal of research during the past few decades. This give birth to Scene Character Recognition (SCR) which is an important step in scene text recognition pipeline. In this paper, we extended the Bag of Features (BoF)-based model using deep learning for representing features for accurate SCR of different languages. In the features coding step, a deep Sparse Auto-encoder (SAE)-based strategy was applied to enhance the representative and discriminative abilities of image features. This deep learning architecture provides more efficient features representation and therefore a better recognition accuracy. Our system was evaluated extensively on all the scene character datasets of five different languages. The experimental results proved the efficiency of our system for a multilingual SCR.

研究动机与目标

  • 通过增强袋模型(BoF)框架中的局部特征表示,提升多语言场景文字识别(SCR)的性能。
  • 解决传统BoF在捕捉多语言场景文字中具有判别性和鲁棒性的特征方面的局限性。
  • 将深度学习——特别是稀疏自编码器——整合到BoF流程中,实现更高效且更具代表性的特征编码。
  • 在多样化的多语言场景文字数据集上评估所提出的系统,以检验其跨语言泛化能力和鲁棒性。
  • 证明基于SAE的特征学习相比标准BoF方法能显著提升识别准确率。

提出的方法

  • 系统采用袋模型(BoF)流程,从场景图像中提取SIFT或类似局部特征。
  • 在局部图像块上训练深度稀疏自编码器(SAE),以学习紧凑、分布式且具有判别性的特征表示。
  • SAE取代BoF中的标准码书生成过程,实现更信息量丰富的视觉词表示的端到端学习。
  • 利用学习到的SAE特征构建基于直方图的图像表示用于分类。
  • 在五个多语言场景文字数据集上进行模型训练与评估,包含语言特定的数据以支持跨语言评估。
  • 通过引入稀疏性约束训练SAE,以促进高效且稀疏的特征激活,增强判别能力。

实验结果

研究问题

  • RQ1深度稀疏自编码器能否提升BoF框架中多语言场景文字识别的局部特征判别能力?
  • RQ2与传统BoF编码相比,基于SAE的特征表示在多种语言下的识别准确率表现如何?
  • RQ3所提出的方法在场景文字识别中对不同文字系统和语言的泛化能力如何?
  • RQ4将深度学习整合到BoF流程中是否能提升复杂场景图像中特征的效率与鲁棒性?
  • RQ5自编码器中的稀疏性正则化对特征质量和识别性能有何影响?

主要发现

  • 所提出的SAE增强型BoF系统在评估的全部五个多语言场景文字数据集上,识别准确率均高于标准BoF方法。
  • 使用稀疏自编码器显著改善了特征表示,能够捕捉到更具判别性和紧凑性的局部模式。
  • 系统展现出强大的跨语言泛化能力,在拉丁文、阿拉伯文、中文、日文和韩文等多种文字系统中均保持高性能。
  • 自编码器中的稀疏性约束促进了更高效且有意义的特征学习,减少了冗余并提升了分类性能。
  • 该方法在低对比度或噪声较多的复杂场景图像中,显著优于基线BoF模型。
  • 结果证实,通过SAE进行深度特征学习能有效增强BoF框架在多语言场景文字识别中的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。