[论文解读] Abstractive Information Extraction from Scanned Invoices (AIESI) using End-to-end Sequential Approach
该论文提出了一种用于从扫描件发票中进行摘要式信息抽取(AIESI)的端到端序列模型,通过在边界框级别整合文本、视觉和空间特征,采用基于 BERT 嵌入的词级双向长短期记忆网络(BiLSTM)与 ResNet50 提取视觉特征。该方法在 SROIE 数据集上取得了 88.2% 的 F1 分数,优于字符级和词级 BiLSTM 基线模型,证明了在关键参数抽取中准确率更高且连续性标签错误更少。
Recent proliferation in the field of Machine Learning and Deep Learning allows us to generate OCR models with higher accuracy. Optical Character Recognition(OCR) is the process of extracting text from documents and scanned images. For document data streamlining, we are interested in data like, Payee name, total amount, address, and etc. Extracted information helps to get complete insight of data, which can be helpful for fast document searching, efficient indexing in databases, data analytics, and etc. Using AIESI we can eliminate human effort for key parameters extraction from scanned documents. Abstract Information Extraction from Scanned Invoices (AIESI) is a process of extracting information like, date, total amount, payee name, and etc from scanned receipts. In this paper we proposed an improved method to ensemble all visual and textual features from invoices to extract key invoice parameters using Word wise BiLSTM.
研究动机与目标
- 解决从具有可变布局的扫描件发票中高精度、低歧义地提取关键参数(如日期、总金额、付款人姓名)的挑战。
- 克服基于规则和分类方法的 KIPE 方法在异构发票结构上泛化能力不足的局限性。
- 通过将边界框视为原子单元而非单词或字符,减少关键参数抽取中的不连续或错误标签预测。
- 通过整合视觉特征(使用 ResNet50)和空间特征(归一化坐标、面积比)以及深度上下文文本嵌入(BERT),提升性能。
- 为自动化会计和数据归档等商业应用提供稳健、可扩展且支持多语言的文档处理能力。
提出的方法
- 采用边界框级别的表征方式,将每个发票区域编码为文本、视觉和空间特征的组合。
- 使用 BERT-base 获取上下文相关的词嵌入,将命名实体映射为 #NAME#,数字映射为 #NUMBER#,以增强鲁棒性。
- 应用 ResNet50 从裁剪后的边界框中提取视觉嵌入,捕捉版式和字体特征。
- 集成手工设计的空间特征:归一化坐标、相对于文档的面积比,以及每单位面积的字符密度。
- 将 768 维的 BERT 嵌入、128 维的视觉特征和 6 维的空间特征融合为每个边界框的统一向量。
- 在拼接后的特征向量上训练词级双向长短期记忆网络(BiLSTM)分类器,以预测每个边界框的关键参数标签(如 'date'、'total')。
实验结果
研究问题
- RQ1将视觉和空间特征与深度上下文文本嵌入相结合,是否能提升在布局多变的扫描件发票上的关键信息抽取准确率?
- RQ2与基于字符或词的序列标注相比,边界框级别的分类是否能更有效地减少不连续或错误的标签预测?
- RQ3与基于规则和传统分类方法的 KIPE 模型相比,所提出的端到端模型在真实世界发票数据集上的表现如何?
- RQ4视觉和空间特征在多大程度上促进了对异构发票结构的泛化能力?
- RQ5该模型能否在商业应用中实现高准确率和低延迟,支持可扩展的多语言文档处理?
主要发现
- 所提模型在 SROIE 数据集上达到 88.2% 的 F1 分数,显著优于字符级 BiLSTM(75.4%)和词级 BiLSTM(83.4%)。
- 视觉和空间特征的融合带来了更一致且准确的标签预测,减少了序列模型中常见的不连续标签问题。
- 边界框级别的分类提升了关键参数的定位与标注能力,即使在文本碎片化或格式不规则时也表现良好。
- 该模型对发票中结构多样性的鲁棒性表现良好,适用于文档密集型领域的实际部署。
- 性能高度依赖于初始 OCR 和边界框检测的准确性;定位不佳会显著降低整体流水线性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。