[论文解读] Deep Relational Reasoning Graph Network for Arbitrary Shape Text Detection
本文提出了一种统一的端到端可训练深度关系推理图网络(DRRG),用于任意形状文本检测,通过局部图将基于CNN的文本提议网络与基于GCN的关系推理网络相连接。通过图卷积网络建模组件间的关系,DRRG实现了最先进性能,在ICDAR2015上达到86.56%的H-mean,在CTW1500上达到84.45%。
Arbitrary shape text detection is a challenging task due to the high variety and complexity of scenes texts. In this paper, we propose a novel unified relational reasoning graph network for arbitrary shape text detection. In our method, an innovative local graph bridges a text proposal model via Convolutional Neural Network (CNN) and a deep relational reasoning network via Graph Convolutional Network (GCN), making our network end-to-end trainable. To be concrete, every text instance will be divided into a series of small rectangular components, and the geometry attributes (e.g., height, width, and orientation) of the small components will be estimated by our text proposal model. Given the geometry attributes, the local graph construction model can roughly establish linkages between different text components. For further reasoning and deducing the likelihood of linkages between the component and its neighbors, we adopt a graph-based network to perform deep relational reasoning on local graphs. Experiments on public available datasets demonstrate the state-of-the-art performance of our method.
研究动机与目标
- 解决现有方法因刚性几何假设而难以检测任意形状、弯曲及多方向场景文本的挑战。
- 通过学习稳定、数据驱动的文本组件间关系结构,克服基于规则或嵌入的连通组件(CC)方法的局限性。
- 提出一种新型局部图模块,实现基于CNN的文本提议网络与基于GCN的关系推理网络之间的端到端训练。
- 通过基于图的关系推理建模几何与空间关系,提升对长文本、弯曲文本及密集排列文本实例的检测准确率与鲁棒性。
- 在多个基准数据集上实现最先进性能,涵盖多边形与四边形数据集,证明了在不同文本形状与方向上的泛化能力。
提出的方法
- 将每个文本实例划分为小矩形组件,并使用基于CNN的文本提议网络估计其几何属性(高度、宽度、方向)。
- 为每个文本实例构建局部图,其中每个组件为一个节点,边表示基于几何接近度与方向相似性的潜在连接。
- 应用图卷积网络(GCN)在局部图上执行深度关系推理,推断组件间真实连接的可能性。
- 利用GCN预测的连接分数指导后处理分组,基于学习到的关系置信度将组件合并为完整文本实例。
- 设计可微分的局部图构建模块,实现文本提议网络与关系推理网络之间的端到端训练。
- 采用多尺度数据增强与图像缩放策略(短边调整为512或960,长边限制)以提升在多样化场景文本尺度与长宽比下的泛化能力。
实验结果
研究问题
- RQ1与基于规则或嵌入的方法相比,基于图的关系推理机制是否能提升任意形状文本检测中不连通文本组件的分组性能?
- RQ2基于GCN的网络在多大程度上能够建模文本组件间的长距离与非相邻关系,以增强对弯曲及多方向文本的检测能力?
- RQ3将可微分局部图集成到基于CNN的提议网络与基于GCN的关系推理网络之间,是否能带来优于级联或不可微分流水线的端到端性能?
- RQ4在多种基准数据集上,该方法在检测长文本、弯曲文本及密集排列文本实例方面,与最先进方法相比表现如何?
- RQ5所提出的框架是否能在无需架构修改的情况下,泛化到不同文本形状(多边形、四边形)及多语言场景?
主要发现
- 所提出的DRRG方法在ICDAR2015数据集上达到86.56%的H-mean,显著优于先前最先进方法如FOTS(85.31%)和ATRR(86.8%)。
- 在CTW1500数据集上,DRRG达到84.45%的H-mean与83.02%的召回率,相较于TextSnake在H-mean上提升8.85%,展现出在弯曲与多方向文本上的强劲性能。
- 在MSRA-TD500数据集上,DRRG达到85.08%的H-mean,表明其在检测长文本与尺度变化文本实例方面具有鲁棒性。
- 在ICDAR2017 MLT上,该方法达到67.31%的H-mean,优于大多数现有方法,包括FOTS(67.25%)与LOMO(68.5%),表明其在多语言场景下的强大泛化能力。
- 消融实验证实,基于GCN的关系推理模块显著提升了检测性能,尤其在存在重叠或弯曲文本的复杂场景中表现突出。
- 采用可微分局部图的端到端可训练设计,相比不可微分的分组模块,实现了更优的优化效果与更稳定的预测结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。