[论文解读] Exploring Geometric Property Thresholds For Filtering Non-Text Regions In A Connected Component Based Text Detection Application
本文研究了在基于连通域的文本检测中,使用MSER和线宽变化方法过滤非文本区域时的几何属性阈值。结果表明,手动调优的宽高比、偏心率、完整度和线宽变化阈值能有效检测自然与非自然场景中的文本,其中提高线宽变化的最大阈值并减少边界框扩展量,可显著提升在风格化、高对比度非自然图像中的检测效果。
Automated text detection is a difficult computer vision task. In order to accurately detect and identity text in an image or video, two major problems must be addressed. The primary problem is implementing a robust and reliable method for distinguishing text vs non-text regions in images and videos. Part of the difficulty stems from the almost unlimited combinations of fonts, lighting conditions, distortions, and other variations that can be found in images and videos. This paper explores key properties of two popular and proven methods for implementing text detection; maximum stable external regions (MSER) and stroke width variation.
研究动机与目标
- 评估字体样式及图像特性(如模糊、对比度、纹理)对文本检测中几何属性阈值的影响。
- 确定在多种图像类型中,哪些几何属性(如宽高比、偏心率、完整度)最有效用于过滤非文本区域。
- 评估MSER与线宽变化在不同条件下的文本检测鲁棒性,特别是在产品包装等非自然场景中的表现。
- 识别可提升在非自然图像中高度风格化或自定义字体检测性能的阈值调优策略。
- 为自动化阈值选择奠定基础,以增强现实世界文本检测系统中的可扩展性与鲁棒性。
提出的方法
- 在灰度图像中使用最大稳定外部区域(MSER)进行初始区域检测。
- 从MSER区域中提取几何属性——宽高比、偏心率、完整度、覆盖率、欧拉数,以过滤非文本候选区域。
- 应用线宽变化度量:线宽标准差除以均值线宽,结合最大方差阈值使用。
- 通过基于标准差的拉伸方法进行图像对比度增强,作为预处理步骤。
- 实施边界框扩展与合并,将单个字符检测结果整合为单词或行候选区域。
- 使用MATLAB的Tesseract基于OCR引擎进行文本识别验证,并通过视觉检查确认检测区域。
实验结果
研究问题
- RQ1自然与非自然场景图像中的不同字体样式如何影响文本检测的最优几何属性阈值?
- RQ2在多种图像类型中,哪些几何属性(如宽高比、完整度、偏心率)最能有效区分文本与非文本区域?
- RQ3图像特异性特征(如高对比度、模糊、纹理)如何影响可靠文本检测所需的阈值大小?
- RQ4自定义或高度风格化的字体在多大程度上需要调整线宽变化与边界框扩展参数?
- RQ5是否可通过手动调优的轻量级系统(结合MSER与线宽变化)在自然与非自然场景中实现鲁棒的文本检测?
主要发现
- 在手动调优几何阈值后,该方法成功检测出自然与非自然图像中的主要及次要文本区域。
- 与自然图像相比,非自然图像中线宽变化的最大阈值需提高一倍(即增加2倍),才能检测到所有字符。
- 减少相邻边界框的扩展量可提升非自然图像中的检测效果,尤其适用于宽幅或间距不规则的文本。
- 通过基于标准差的拉伸方法进一步增强对比度后,高对比度图像的性能下降,表明存在阈值效应。
- 尽管面临风格化字体与高对比度的挑战,MSER与线宽变化的组合仍表现出鲁棒性,对阈值敏感度影响极小。
- 使用Tesseract的OCR模块可成功识别标准英文文本而无需重新训练,但自定义字体未来仍需模型微调。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。