Skip to main content
QUICK REVIEW

[论文解读] Detecting Oriented Text in Natural Images by Linking Segments

Baoguang Shi, Xiang Bai|arXiv (Cornell University)|Mar 19, 2017
Handwritten Text Recognition Techniques参考文献 24被引用 14
一句话总结

本文提出 SegLink,一种新颖的定向文本检测方法,通过将文本分解为可检测的片段和连接关系,利用全卷积神经网络联合预测片段(定向边界框)和连接关系(相邻片段之间的连接)。该方法在 ICDAR 2015 上实现了 75.0% 的 F-measure,达到当前最先进性能,推理速度超过 20 FPS,且无需修改即可自然处理中文等非拉丁文本。

ABSTRACT

Most state-of-the-art text detection methods are specific to horizontal Latin text and are not fast enough for real-time applications. We introduce Segment Linking (SegLink), an oriented text detection method. The main idea is to decompose text into two locally detectable elements, namely segments and links. A segment is an oriented box covering a part of a word or text line; A link connects two adjacent segments, indicating that they belong to the same word or text line. Both elements are detected densely at multiple scales by an end-to-end trained, fully-convolutional neural network. Final detections are produced by combining segments connected by links. Compared with previous methods, SegLink improves along the dimensions of accuracy, speed, and ease of training. It achieves an f-measure of 75.0% on the standard ICDAR 2015 Incidental (Challenge 4) benchmark, outperforming the previous best by a large margin. It runs at over 20 FPS on 512x512 images. Moreover, without modification, SegLink is able to detect long lines of non-Latin text, such as Chinese.

研究动机与目标

  • 解决通用目标检测器在检测具有极端长宽比的长条形定向文本时的局限性。
  • 提升检测速度并简化训练流程,以实现实时定向文本检测。
  • 在无需架构修改的情况下,实现对非拉丁文本(如中文)的鲁棒检测。
  • 通过建模局部可检测的组件——片段和连接关系——来表示文本结构,而非依赖全局候选框提议。

提出的方法

  • 该方法将文本分解为片段(覆盖单词部分的定向框)和连接关系(表示相邻片段属于同一单词的连接)。
  • 采用 VGG-16 主干网络的全卷积神经网络,在六个特征层上多尺度检测片段和连接关系。
  • 使用两种连接关系:层内连接(同一层上相邻片段之间的连接)和跨层连接(相邻特征层上片段之间的连接),以连接空间和尺度相关的片段。
  • 基于检测到的连接关系,使用深度优先搜索(DFS)算法将片段组合成完整单词。
  • 网络通过多任务损失端到端训练,同时预测片段和连接关系。
  • 后处理采用非极大值抑制和阈值过滤(α 和 β)以去除冗余检测结果。

实验结果

研究问题

  • RQ1全卷积、端到端的深度学习模型是否能比现有方法更准确高效地检测定向文本?
  • RQ2片段-连接策略是否能在不修改架构的情况下泛化到非拉丁文本(如中文)?
  • RQ3将文本建模为局部可检测片段与连接关系的序列,是否能提升在复杂背景和可变长宽比下的鲁棒性?
  • RQ4SegLink 在标准基准测试中,对定向和水平文本的性能与当前最先进方法相比如何?

主要发现

  • SegLink 在 ICDAR 2015 Incidental(挑战 4)基准上达到 75.0% 的 F-measure,显著优于此前最佳方法(64.8%)。
  • 该方法在 512×512 图像上推理速度超过 20 FPS,相比先前方法展现出更高的推理效率。
  • SegLink 无需任何结构修改,即可成功检测多语言场景中的长段非拉丁文本(如中文)。
  • 在 TD500 数据集上,SegLink 实现了对比方法中最高的精度(86%)和 F-measure(77%),推理速度为 8.9 FPS。
  • 在 IC13 水平文本基准上,SegLink 达到 85.3% 的 F-measure 和 20.6 FPS,F-measure 排名第二,且显著快于多数先前方法。
  • 失败案例包括字符间距过大和弯曲文本,主要由于片段组合算法的局限性,当前仅生成矩形框。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。