Skip to main content
QUICK REVIEW

[论文解读] Digitizing Historical Balance Sheet Data: A Practitioner's Guide

Sergio Correia, Stephan Luck|arXiv (Cornell University)|Mar 31, 2022
Stock Market Forecasting Methods参考文献 40被引用 9
一句话总结

本文提出了一种实用的开源框架——quipucamayoc,通过结合OCR与预处理和后处理技术,实现对大规模历史资产负债表数据的高精度数字化。通过利用基于云的OCR、版面分析、拼写检查以及会计恒等式验证,该方法即使在扫描质量较差的情况下也能实现高准确率,从而实现经济史学家低成本的大规模数据提取。

ABSTRACT

This paper discusses how to successfully digitize large-scale historical micro-data by augmenting optical character recognition (OCR) engines with pre- and post-processing methods. Although OCR software has improved dramatically in recent years due to improvements in machine learning, off-the-shelf OCR applications still present high error rates which limit their applications for accurate extraction of structured information. Complementing OCR with additional methods can however dramatically increase its success rate, making it a powerful and cost-efficient tool for economic historians. This paper showcases these methods and explains why they are useful. We apply them against two large balance sheet datasets and introduce quipucamayoc, a Python package containing these methods in a unified framework.

研究动机与目标

  • 解决从历史扫描文档中高精度、低成本提取结构化资产负债表数据的挑战。
  • 通过模块化、可重用的处理流程自动化数字化,减少对手动数据录入的依赖。
  • 为编程经验有限的研究人员提供一种实用、开源的解决方案,整合OpenCV和云OCR(如AWS Textract)等成熟工具。
  • 使研究人员能够专注于领域特定的验证和错误检测,而非低层次的OCR管理。
  • 在两个大规模、多样化的数据集上展示该方法的有效性:1867–1904年美国国家银行报告和1915–1933年德国企业资产负债表。

提出的方法

  • 采用包含三个核心阶段的数据提取流程:预处理(图像去畸变、对比度调整)、使用商业OCR引擎(如Google Vision、AWS Textract)进行OCR和版面识别,以及通过验证逻辑进行后处理。
  • 使用针对金融术语训练的拼写检查器,校正数值和文本字段中的OCR错误。
  • 利用会计恒等式(如资产负债表恒等式:资产 = 负债 + 股东权益)检测并纠正提取数据中的结构性不一致。
  • 实施人机协同验证步骤,研究人员通过创建“真实值”数据集来基准测试并调优处理流程的准确性。
  • 构建一个模块化的Python包quipucamayoc,封装OCR集成、预处理和验证逻辑,并提供命令行和程序化接口。
  • 通过包的命令行工具(如`quipu extract -tables`)实现轻量级、无需编写代码的OCR处理,适用于小规模项目。

实验结果

研究问题

  • RQ1如何在大规模场景下实现基于OCR的历史资产负债表数字化的高精度与低成本?
  • RQ2哪些预处理和后处理技术能显著提升低质量扫描文档中结构化财务数据的OCR准确率?
  • RQ3会计恒等式在多大程度上可用于验证和校正资产负债表数据的OCR输出?
  • RQ4统一的开源软件框架在多大程度上能降低经济史学家数字化历史微观数据的技术门槛?
  • RQ5研究人员如何在不编写自定义OCR引擎的前提下高效优化OCR处理流程?

主要发现

  • 将OCR应用于字符准确率为95%的表格(含60个数字)时,错误率超过95%,凸显了后处理的必要性。
  • OCR结合预处理、拼写检查和会计恒等式验证显著降低了错误率,实现了从大规模数据集中可靠提取数据。
  • quipucamayoc包成功以高精度数字化了1867–1904年超过10万份美国国家银行资产负债表和1915–1933年3万份德国企业资产负债表。
  • 通过使用人工验证的真实值数据,研究人员能够构建准确率指标,并迭代优化处理流程参数。
  • quipucamayoc中的命令行工具使非程序员无需编写Python代码即可执行OCR和数据提取。
  • 该框架的模块化设计使研究人员能够从简单开始,仅在需要时逐步增加复杂性,避免过早优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。