[论文解读] Arbitrary Shape Scene Text Detection with Adaptive Text Region Representation
该论文提出了一种新颖的场景文本检测方法,采用具有自适应文本区域表示的循环神经网络(RNN),通过迭代预测边界点来检测任意形状的文本区域。该方法在五个基准数据集上实现了最先进性能,尤其在CTW1500等曲线文本数据集以及MSRA-TD500等多方向文本数据集上取得了显著提升。
Scene text detection attracts much attention in computer vision, because it can be widely used in many applications such as real-time text translation, automatic information entry, blind person assistance, robot sensing and so on. Though many methods have been proposed for horizontal and oriented texts, detecting irregular shape texts such as curved texts is still a challenging problem. To solve the problem, we propose a robust scene text detection method with adaptive text region representation. Given an input image, a text region proposal network is first used for extracting text proposals. Then, these proposals are verified and refined with a refinement network. Here, recurrent neural network based adaptive text region representation is proposed for text region refinement, where a pair of boundary points are predicted each time step until no new points are found. In this way, text regions of arbitrary shapes are detected and represented with adaptive number of boundary points. This gives more accurate description of text regions. Experimental results on five benchmarks, namely, CTW1500, TotalText, ICDAR2013, ICDAR2015 and MSRATD500, show that the proposed method achieves state-of-the-art in scene text detection.
研究动机与目标
- 解决现有方法在检测曲线或多方向文本等任意形状场景文本时仍具挑战性的问题。
- 通过用自适应、可变长度的边界点表示替代固定边界框,提升不规则文本区域的检测精度。
- 实现在不同光照、语言和文本长度等多样化真实场景下的高效且精确的场景文本检测。
- 在保持高推理速度的同时,于多个基准数据集上实现最先进性能。
提出的方法
- 使用文本区域提议网络(Text-RPN)从输入图像中生成初始文本提议。
- 通过包含三个分支的优化网络对提议进行细化:文本/非文本分类、边界框回归以及基于RNN的自适应边界点预测。
- 采用RNN在每个时间步预测一对边界点,直至生成停止信号,从而实现对任意形状文本区域的可变长度表示。
- 使用ROI池化从CNN主干网络中为每个文本提议提取特征图,并将其输入优化网络以实现精确定位。
- 采用端到端的多任务学习进行模型训练,同时优化分类、定位和自适应边界点生成任务。
- 通过自适应数量的成对边界点表示检测到的文本区域,实现对曲线和不规则形状的灵活且精确建模。
实验结果
研究问题
- RQ1与固定边界框表示相比,基于RNN的自适应边界点预测机制是否能提升对任意形状场景文本的检测精度?
- RQ2在包含CTW1500和MSRA-TD500等具有挑战性的曲线和多方向文本的基准数据集上,所提方法表现如何?
- RQ3该方法是否能在实现最先进精度的同时保持高推理速度?
- RQ4自适应表示策略是否在多种场景下具有良好泛化能力,包括多语言、长文本行以及低光照条件?
主要发现
- 在CTW1500基准上,该方法实现了78.5%的平均H-mean,优于此前最先进方法如TextSnake(78.4%)和Mask Textspotter(78.4%)。
- 在MSRA-TD500数据集上,该方法实现了83.6%的H-mean,超越所有先前方法,包括InceptText(83.0%)和MCN(83.0%)。
- 在ICDAR2013上,该方法实现了91.7%的H-mean,在单尺度、单模型评估下与最佳性能方法Mask Textspotter持平。
- 在ICDAR2015上,该方法实现了87.6%的H-mean,排名第二,仅次于采用端到端检测与识别训练的FOTS方法。
- 在720×720输入下,该方法推理速度达到10.0 fps,显著快于TextSnake(1.1 fps)和Mask Textspotter(6.9 fps),主要得益于避免了逐像素预测。
- 定性结果表明,该方法在多种复杂场景下表现稳健,包括曲线文本、多语言内容、长文本行以及不同光照条件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。