[论文解读] Incidental Scene Text Understanding: Recent Progresses on ICDAR 2015 Robust Reading Competition Challenge 4
本文提出了一种基于深度学习的偶然场景文本理解方法,将文本检测建模为使用全卷积网络(FCN)的语义分割问题,结合CNN-LSTM与联结主义时间分类(CTC)进行单词识别,并将两者整合以实现端到端识别。该方法在ICDAR 2015鲁棒阅读竞赛挑战4中取得了最先进性能,在文本定位任务上的F-measure为0.6376,单词识别任务上的F-measure为0.6399,强上下文条件下端到端识别的F-measure为0.4674。
Different from focused texts present in natural images, which are captured with user's intention and intervention, incidental texts usually exhibit much more diversity, variability and complexity, thus posing significant difficulties and challenges for scene text detection and recognition algorithms. The ICDAR 2015 Robust Reading Competition Challenge 4 was launched to assess the performance of existing scene text detection and recognition methods on incidental texts as well as to stimulate novel ideas and solutions. This report is dedicated to briefly introduce our strategies for this challenging problem and compare them with prior arts in this field.
研究动机与目标
- 解决偶然场景文本检测与识别的挑战,其固有复杂性高于聚焦文本,原因包括模糊、倾斜、光照不足和背景杂乱。
- 在ICDAR 2015鲁棒阅读竞赛挑战4上评估现有方法,该挑战聚焦于真实世界、非受限的自然图像。
- 开发并验证针对偶然场景文本的文本检测、单词识别和端到端识别的新型策略。
- 证明整体性深度学习方法在复杂真实世界数据上优于传统局部化检测方法的优越性。
提出的方法
- 将场景文本检测建模为语义分割问题,使用全卷积网络(FCN)预测每个像素属于文本区域的概率。
- 对FCN预测图应用阈值化和连通域分析,生成最终的文本边界框。
- 实现一种混合识别模型,结合卷积层、长短期记忆(LSTM)循环网络和联结主义时间分类(CTC)层,用于序列建模。
- 集成基于词典的错误校正模块,以优化初始识别输出并提升单词级准确率。
- 将所提出的检测与识别模型整合为端到端系统,实现联合优化与推理。
- 在ICDAR 2015数据集上训练并评估模型,使用标准指标包括F-measure、总编辑距离(TED)和正确识别单词率(C.R.W.)。
实验结果
研究问题
- RQ1整体性FCN-based语义分割方法与传统局部候选生成方法相比,在偶然场景文本检测中表现如何?
- RQ2在具有挑战性的偶然场景文本上,CNN-LSTM-CTC架构结合基于词典的错误校正能在多大程度上提升单词识别准确率?
- RQ3将检测与识别模块整合为端到端系统,是否能在真实世界非受限数据上优于独立处理的流水线?
- RQ4所提出方法在ICDAR 2015基准测试的不同上下文设置(强、弱、通用)下表现如何?
- RQ5与先前最先进方法相比,该方法在ICDAR 2015挑战4和挑战1数据集上的相对性能提升如何?
主要发现
- 所提出的文本检测方法(Megvii-Image++)在ICDAR 2015文本定位任务上取得了0.6376的F-measure,显著优于此前SOTA方法(0.4984)。
- 在单词识别任务中,该方法将总编辑距离(TED)降低至377.9,正确识别单词率(C.R.W.)提升至0.6399,较先前方法有显著改进。
- 在强上下文设置下的端到端识别任务中,该方法取得了0.4674的F-measure,为所有参赛方法中的最高值。
- 在更具现实意义的弱上下文设置和通用设置下,该方法各项指标几乎翻倍,F-measure分别达到0.400和0.3286。
- 在ICDAR 2015挑战1(数码生成)数据集上,该系统在强设置下保持了SOTA性能,F-measure达到0.8535。
- 该方法展现出鲁棒性与泛化能力,在多样且具有挑战性的现实世界场景文本场景中均表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。