Skip to main content
QUICK REVIEW

[论文解读] Handwritten Text Segmentation via End-to-End Learning of Convolutional Neural Network

Junho Jo, Hyung Il Koo|arXiv (Cornell University)|Jun 12, 2019
Handwritten Text Recognition Techniques参考文献 15被引用 4
一句话总结

本文提出一种端到端卷积神经网络(CNN),用于混合模式文档中的手写文本分割,通过将任务表述为像素级分类,绕过传统的两步预处理。该方法采用U-Net架构,并引入一种新颖的动态平衡交叉熵损失与焦点损失,以解决类别不平衡问题,同时提出一种数据合成流程,生成带有像素级标注的逼真训练图像。模型仅在合成数据上进行训练,将真实手写文档的OCR准确率从71.13%提升至92.50%。

ABSTRACT

We present a new handwritten text segmentation method by training a convolutional neural network (CNN) in an end-to-end manner. Many conventional methods addressed this problem by extracting connected components and then classifying them. However, this two-step approach has limitations when handwritten components and machine-printed parts are overlapping. Unlike conventional methods, we develop an end-to-end deep CNN for this problem, which does not need any preprocessing steps. Since there is no publicly available dataset for this goal and pixel-wise annotations are time-consuming and costly, we also propose a data synthesis algorithm that generates realistic training samples. For training our network, we develop a cross-entropy based loss function that addresses the imbalance problems. Experimental results on synthetic and real images show the effectiveness of the proposed method. Specifically, the proposed network has been trained solely on synthetic images, nevertheless the removal of handwritten text in real documents improves OCR performance from 71.13% to 92.50%, showing the generalization performance of our network and synthesized images.

研究动机与目标

  • 为解决扫描文档中重叠手写与印刷体文字分离的挑战,该挑战对传统两步法而言仍具难度。
  • 通过将分割任务表述为端到端的像素级分类,消除对二值化和连通域提取等预处理步骤的依赖。
  • 通过一种新型损失函数,缓解训练过程中手写像素与背景像素之间严重的类别不平衡问题。
  • 生成具有精确像素级标注的逼真合成训练数据,因为目前尚无公开数据集可用于此任务。

提出的方法

  • 该方法使用基于U-Net的CNN执行像素级分类,将手写文本像素标记为'1',其余(背景、印刷体文字、表格等)标记为'-1'。
  • 提出一种新型损失函数——动态平衡交叉熵(DBCE),通过自适应加权稀有(手写)类与常见(背景)类,缓解类别不平衡问题。
  • 通过引入焦点损失进一步增强损失函数,以应对印刷体文字区域误分类导致性能下降的严重问题。
  • 通过结合扫描的手写文本(来自IAM数据集)、印刷体文字(来自PRImA数据集)和表格图像,构建数据合成流程,生成逼真的文档图像,同时保留纹理与噪声特征。
  • 合成方法利用图像混合与几何变换,模拟真实文档中常见的重叠与形变。
  • 网络仅在合成数据上进行训练,从而实现对真实世界文档的泛化,无需使用真实标注数据。

实验结果

研究问题

  • RQ1端到端深度学习方法是否能在重叠混合模式文档中对手写文本分割的表现优于传统两阶段方法(如连通域提取+分类)?
  • RQ2在手写像素稀疏的合成数据上训练时,动态平衡交叉熵损失在缓解类别不平衡问题方面效果如何?
  • RQ3仅在合成数据上训练的模型,对具有复杂重叠的现实世界文档图像的泛化能力如何?
  • RQ4数据合成方法能否生成保留真实扫描文档视觉与结构特性的逼真训练样本?

主要发现

  • 尽管仅在合成数据上训练,该模型在去除检测到的手写像素后,将真实手写文档图像的OCR准确率从71.13%提升至92.50%,展现出强大的泛化能力。
  • 与标准交叉熵相比,动态平衡交叉熵损失(DBCE)显著降低了手写像素的误分类率,在合成数据上的IoU从95.88%提升至97.20%。
  • DBCE与焦点损失结合(DBCEF)在合成测试集上达到最高的测试IoU(97.80%),优于单一组件及基线模型。
  • 消融实验证实DBCE与焦点损失均不可或缺:DBCE缓解类别不平衡,焦点损失降低印刷体区域的误分类。
  • 使用完整DBCEF损失时,模型在合成验证集上的IoU达到99.94%,表明在合成数据上具有极高的分割精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。