Skip to main content
QUICK REVIEW

[论文解读] Degraded Historical Documents Images Binarization Using a Combination of Enhanced Techniques

Omar Boudraa, Walid Khaled Hidouci|arXiv (Cornell University)|Jan 27, 2019
Handwritten Text Recognition Techniques参考文献 3被引用 4
一句话总结

本文提出了一种针对退化历史文档的三阶段混合二值化框架,结合了对比度受限自适应直方图均衡化(CLAHE)以增强对比度,利用局部对比度作为决策准则融合Otsu、多级Otsu和Nick的阈值分割方法,并通过形态学后处理去除噪声。该方法在DIBCO和H-DIBCO基准测试中达到最先进性能,F-measure得分分别为87.23%(DIBCO 2013)、92.40%(H-DIBCO 2014)和85.08%(H-DIBCO 2016),优于Otsu、Sauvola和Niblack方法。

ABSTRACT

Document image binarization is the initial step and a crucial in many document analysis and recognition scheme. In fact, it is still a relevant research subject and a fundamental challenge due to its importance and influence. This paper provides an original multi-phases system that hybridizes various efficient image thresholding methods in order to get the best binarization output. First, to improve contrast in particularly defective images, the application of CLAHE algorithm is suggested and justified. We then use a cooperative technique to segment image into two separated classes. At the end, a special transformation is applied for the purpose of removing scattered noise and of correcting characters forms. Experimentations demonstrate the precision and the robustness of our framework applied on historical degraded documents images within three benchmarks compared to other noted methods.

研究动机与目标

  • 解决在非均匀光照、噪声、模糊和低对比度条件下对退化历史文档图像进行二值化的长期挑战。
  • 通过在混合框架中结合多种阈值分割技术,提升二值化精度。
  • 通过预处理(CLAHE)和后处理(连通域分析与形态学操作)提升图像质量。
  • 利用标准化基准测试评估该方法在多种退化类型下的鲁棒性。
  • 证明其在性能上优于已有的全局与自适应阈值分割方法。

提出的方法

  • 预处理采用对比度受限自适应直方图均衡化(CLAHE),以增强低对比度退化文档图像的对比度。
  • 混合二值化方法应用Otsu、多级Otsu和Nick的阈值分割方法,以局部平均对比度作为决策准则,选择每区域的最优阈值。
  • 决策准则选择在最大化类间方差的同时,考虑局部对比度变化的三种方法中的最优阈值。
  • 后处理采用连通域分析与形态学操作(如开运算和闭运算),以去除孤立噪声并校正字符形状。
  • 该框架以协作方式整合三种不同的阈值分割算法,避免依赖单一方法的局限性。
  • 通过经验性调参对十一个参数进行调整,未来工作建议采用模糊逻辑或深度学习实现自动化调参。

实验结果

研究问题

  • RQ1将全局与自适应阈值分割方法混合使用,能否显著提升在严重退化历史文档上的二值化精度?
  • RQ2CLAHE预处理是否能显著提升在低对比度文档图像中后续阈值分割技术的性能?
  • RQ3在多种基准测试中,该方法与Otsu、Niblack、Sauvola和Nick方法相比,在F-measure、DRD和PSNR指标上的表现如何?
  • RQ4采用形态学操作与连通域分析的后处理在多大程度上能减少噪声并改善字符完整性?
  • RQ5在不同退化条件下,具有多种阈值策略的多阶段框架是否比单一方法更具鲁棒性?

主要发现

  • 在DIBCO 2013基准测试中,该方法取得了87.23%的最高F-measure得分,优于Otsu(80.04%)和Sauvola(85.02%)。
  • 在H-DIBCO 2014数据集中,该方法实现了92.40%的F-measure,排名第一,显著优于Otsu(91.63%)和Sauvola(86.83%)。
  • 在H-DIBCO 2016基准测试中,该方法取得了85.08%的F-measure,排名第一,优于Otsu(86.59%)的F-measure,尽管在此情况下Otsu的F-measure略高。
  • 该方法在所有数据集上均表现出最低的DRD(到参考距离)值,表明分割精度更高且失真最小。
  • PSNR值持续高于大多数对比方法,在DIBCO 2013上达到18.35 dB,在H-DIBCO 2014上达到19.09 dB,表明图像质量保持更优。
  • 对二值化结果的视觉检查确认,该方法在文本与背景之间实现了最清晰的分离,噪声最少,且字符形状保持优于Niblack、Otsu和Nick的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。