[论文解读] Joint Layout Analysis, Character Detection and Recognition for Historical Document Digitization
本文提出了一种用于历史文献数字化的端到端、可联合训练的框架,通过双分支网络同时执行版面分析、字符检测与识别:一个字符分支用于逐字符检测与识别,一个版面分支则使用全卷积网络(FCN)生成用于基于霍夫变换的行检测的二值掩码。该方法在扩展的MTHv2数据集上取得了最先进性能,版面分析的F-score达到98.60%,通过利用语言模型的重评分机制,识别正确率达到96.07%。
In this paper, we propose an end-to-end trainable framework for restoring historical documents content that follows the correct reading order. In this framework, two branches named character branch and layout branch are added behind the feature extraction network. The character branch localizes individual characters in a document image and recognizes them simultaneously. Then we adopt a post-processing method to group them into text lines. The layout branch based on fully convolutional network outputs a binary mask. We then use Hough transform for line detection on the binary mask and combine character results with the layout information to restore document content. These two branches can be trained in parallel and are easy to train. Furthermore, we propose a re-score mechanism to minimize recognition error. Experiment results on the extended Chinese historical document MTHv2 dataset demonstrate the effectiveness of the proposed framework.
研究动机与目标
- 为解决传统独立流水线方法在历史文献数字化中的局限性,这些方法在具有复杂版面的退化文档上存在误差累积和鲁棒性差的问题。
- 开发一种端到端可训练的框架,整合版面分析、字符检测与识别,以提高准确率并简化处理流程。
- 通过重评分机制利用隐式语言模型,增强在受损历史文献上的识别鲁棒性。
- 通过发布扩展的、完全标注的中文历史文献数据集(MTHv2),包含版面、字符和文本行标注,促进未来研究。
提出的方法
- 框架使用特征提取主干网络(ResNet-50)结合特征金字塔网络(FPN)生成多尺度特征。
- 字符分支执行实例级检测与分类,输出单个字符的边界框和类别标签。
- 版面分支采用全卷积网络(FCN)预测二值掩码以指示文本区域,随后通过霍夫变换进行行检测。
- 后处理基于空间邻近性和版面结构将检测到的字符分组为文本行,确保正确的阅读顺序(从右到左、从上到下)。
- 重评分机制结合字符级与文本行级模型的预测结果,利用语言模型先验纠正识别错误,提升鲁棒性。
- 整个框架通过并行优化两个分支实现端到端训练,实现版面与识别任务的联合学习。
实验结果
研究问题
- RQ1端到端框架能否联合优化版面分析、字符检测与识别,以减少历史文献数字化中的误差传播?
- RQ2基于FCN的版面检测方法与传统手工设计方法(如投影轮廓分析)相比,在处理复杂背景和多样化版面时表现如何?
- RQ3利用语言模型的重评分机制在退化历史文献上能将识别准确率提升多少?
- RQ4在多栏版面中,基于字符的检测与识别是否能优于序列化方法,以更好地保持正确的阅读顺序?
主要发现
- 所提框架在MTHv2数据集上的版面分析F-score达到98.60%,显著优于投影轮廓分析方法(F-score为78.17%)。
- 基于FCN的版面分支实现97.77%的精确率与99.44%的召回率,表明其在复杂背景和多样化版面中具有优越鲁棒性。
- 基于字符的方法实现的文本行检测在IoU=0.5时H-mean达到97.72%,优于传统方法以及EAST和Mask R-CNN等模型。
- 重评分机制将正确率(CR)从文本行模型的95.09%和字符模型的94.63%提升至96.07%,表明两种识别流之间具有显著协同效应。
- 该框架实现95.52%的准确率(AR),表明在正确阅读顺序下重建文献方面具有高度可靠性。
- 扩展的MTHv2数据集现已公开,包含版面、字符和文本行的详细标注,为未来中文历史文献分析研究提供支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。