Skip to main content
QUICK REVIEW

[论文解读] Applications of Machine Learning in Document Digitisation

Christian M. Dahl, Torben S. D. Johansen|arXiv (Cornell University)|Feb 5, 2021
Handwritten Text Recognition Techniques参考文献 42被引用 4
一句话总结

本文展示了机器学习如何通过无监督版面分类推断护理日志中的治疗指标,并利用基于注意力的神经网络对丹麦死亡证明书上的手写文本进行识别,从而自动化从扫描的历史文档中收集数据。该方法在端到端转录出生和死亡日期方面达到83.66%的准确率,显著降低了人工转录成本,同时实现了对大规模文档集合的可扩展分析。

ABSTRACT

Data acquisition forms the primary step in all empirical research. The availability of data directly impacts the quality and extent of conclusions and insights. In particular, larger and more detailed datasets provide convincing answers even to complex research questions. The main problem is that 'large and detailed' usually implies 'costly and difficult', especially when the data medium is paper and books. Human operators and manual transcription have been the traditional approach for collecting historical data. We instead advocate the use of modern machine learning techniques to automate the digitisation process. We give an overview of the potential for applying machine digitisation for data collection through two illustrative applications. The first demonstrates that unsupervised layout classification applied to raw scans of nurse journals can be used to construct a treatment indicator. Moreover, it allows an assessment of assignment compliance. The second application uses attention-based neural networks for handwritten text recognition in order to transcribe age and birth and death dates from a large collection of Danish death certificates. We describe each step in the digitisation pipeline and provide implementation insights.

研究动机与目标

  • 解决手动或众包方式转录扫描历史文档所面临的可扩展性和成本限制问题。
  • 证明机器学习能够自动化处理非标准、扫描的纸质文档(如护理日志和死亡证明书)的数据收集。
  • 表明基于机器学习的数字化流程可使用Python、PyTorch和OpenCV等免费工具实现。
  • 评估端到端机器学习流程在真实档案数据集中的版面分类和手写文本识别性能。
  • 突出机器学习在降低人工劳动量的同时,维持可接受准确率以支持大规模历史数据分析的实际优势。

提出的方法

  • 使用聚类技术进行无监督版面分类,以识别和分割护理日志中的治疗字段等文档区域。
  • 在预分割的文档字段上应用基于注意力的神经网络,实现端到端的手写文本识别。
  • 使用Mask R-CNN改进字段级分割,以减少转录错误,特别是对日期字段的影响。
  • 实施置信度阈值筛选,将低置信度预测结果标记以供人工复核,从而支持主动学习循环。
  • 结合转录的年龄和日期字段进行交叉验证,将整体准确率提升至93.56%。
  • 使用包含11,630个日期和11,072个年龄的11,630份扫描丹麦死亡证明书的精选小规模数据集进行训练和评估。

实验结果

研究问题

  • RQ1无监督版面分类是否能在无需人工标注的情况下有效识别历史护理日志中的治疗相关字段?
  • RQ2基于注意力的模型在从扫描的死亡证明书中转录手写文本方面能达到多高的准确率?
  • RQ3在考虑分割和字段级错误的情况下,端到端机器学习性能与众包转录相比如何?
  • RQ4机器学习流程是否能在维持可接受准确率的同时,显著减轻大规模档案文档集合的手动转录负担?
  • RQ5字段级分割在决定历史文档中手写文本识别准确率方面起到何种作用?

主要发现

  • 无监督版面分类在4,000页护理日志的评估集中实现了约1.0的精确率和召回率,揭示了若不进行全量数据集分析则难以发现的治疗分配不合规现象。
  • 端到端机器学习流程在从扫描的死亡证明书中转录出生和死亡日期方面达到83.66%的准确率,其中大部分错误可归因于分割问题,尤其影响年份部分。
  • 年份准确率显著较低,仅为89.11%,而日期和月份的准确率分别达到95.92%和96.98%,表明分割错误对年份字段的影响尤为严重。
  • 当对转录字段进行交叉验证(年龄与日期字段),端到端准确率提升至93.56%,证明多字段一致性检查具有重要价值。
  • 在完全分割的评估集中,机器学习模型达到96%的准确率,表明分割质量是现实性能中的关键瓶颈。
  • 使用机器学习转录200万份文档的成本可忽略不计,相比人工转录,凸显了基于机器学习的数字化流程在可扩展性和成本效益方面的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。