Skip to main content
QUICK REVIEW

[论文解读] Convolutional Neural Networks for Page Segmentation of Historical Document Images

Kai Chen, Mathias Seuret|arXiv (Cornell University)|Apr 5, 2017
Handwritten Text Recognition Techniques被引用 8
一句话总结

本文提出一种仅含一个卷积层的轻量级CNN用于手写历史文档图像的页面分割,将分割任务视为像素级分类问题。通过端到端地从原始图像块中学习特征,该方法在性能上与更深的网络架构相当,表明在公开数据集上,仅需极少的深度和超参数调优即可获得优异结果。

ABSTRACT

This paper presents a Convolutional Neural Network (CNN) based page segmentation method for handwritten historical document images. We consider page segmentation as a pixel labeling problem, i.e., each pixel is classified as one of the predefined classes. Traditional methods in this area rely on carefully hand-crafted features or large amounts of prior knowledge. In contrast, we propose to learn features from raw image pixels using a CNN. While many researchers focus on developing deep CNN architectures to solve different problems, we train a simple CNN with only one convolution layer. We show that the simple architecture achieves competitive results against other deep architectures on different public datasets. Experiments also demonstrate the effectiveness and superiority of the proposed method compared to previous methods.

研究动机与目标

  • 开发一种通用的、端到端的页面分割方法,用于手写历史文档图像,避免依赖手工设计的特征或大量领域知识。
  • 探究仅含一个卷积层的极简CNN架构是否能在文档图像分割任务中取得具有竞争力的性能。
  • 评估池化、卷积核数量、网络深度以及训练数据量等架构组件对分割准确率的影响。
  • 将所提方法的性能与效率与现有的基于规则和基于机器学习的分割技术进行比较。

提出的方法

  • 该方法将页面分割视为像素标注问题,为每个像素分配预定义类别(如文本、装饰物或背景)。
  • 通过超像素算法提取的图像块作为输入,送入一个单卷积层CNN,直接从原始像素学习空间特征。
  • 网络使用ReLU激活函数和Softmax输出进行多类别像素分类,训练采用随机梯度下降法。
  • 评估了最大池化作为潜在组件的作用,但发现其因在布局敏感任务中损失空间精度而降低性能。
  • 模型端到端训练,将特征学习与分类整合于单一优化过程中,避免使用预训练特征提取器。
  • 后处理使用CRF对预测结果进行优化,但核心方法在独立训练与评估中完成。

实验结果

研究问题

  • RQ1与更深的网络架构相比,仅含一个卷积层的简单CNN是否能在手写历史文档图像上实现具有竞争力的分割准确率?
  • RQ2在需要精确空间定位的任务中,引入最大池化如何影响分割性能?
  • RQ3在多样化的历史文档数据集上,实现稳定性能的最优卷积核数量和训练图像数量是多少?
  • RQ4当训练数据有限时,单卷积层CNN的性能是否会下降,尤其是在布局高度多变的情况下?

主要发现

  • 单卷积层CNN在Parzival、CB55和CSG863等公开数据集上的平均交并比(mIoU)得分与更复杂的深度CNN相当。
  • 仅在CB55数据集上添加最大池化层能略微提升性能,但总体上因损失关键的空间细节而降低结果,尤其在布局分割任务中。
  • 卷积核数量(K)在K ≥ 4后影响微乎其微,多数数据集上性能趋于平稳,表明增加核数量的收益递减。
  • 增加卷积层数量并未提升性能,且在G. Washington数据集上略有下降,可能因训练数据有限所致。
  • 当每个数据集的训练图像超过2张后,性能不再显著提升;在G. Washington数据集上,随着训练图像增多,性能甚至略有下降,原因在于布局高度多变且真实标签不一致。
  • 该方法每张图像处理时间约为1秒,在推理速度上优于基于超像素和CRF优化的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。