Skip to main content
QUICK REVIEW

[论文解读] OCR++: A Robust Framework For Information Extraction from Scholarly Articles

Mayank Singh, Barnopriyo Barua|arXiv (Cornell University)|Sep 21, 2016
Biomedical Text Mining and Ontologies被引用 16
一句话总结

OCR++ 是一个开源的混合框架,利用条件随机场(CRF)和手工规则从学术PDF中提取元数据、结构元素(例如,章节标题、表格、图表)以及参考文献信息。与最先进的工具相比,它在准确率上提高了50%,处理速度加快了52%,尤其在存在OCR错误和格式多样性的情况下,其结构信息提取能力表现尤为出色。

ABSTRACT

This paper proposes OCR++, an open-source framework designed for a variety of information extraction tasks from scholarly articles including metadata (title, author names, affiliation and e-mail), structure (section headings and body text, table and figure headings, URLs and footnotes) and bibliography (citation instances and references). We analyze a diverse set of scientific articles written in English language to understand generic writing patterns and formulate rules to develop this hybrid framework. Extensive evaluations show that the proposed framework outperforms the existing state-of-the-art tools with huge margin in structural information extraction along with improved performance in metadata and bibliography extraction tasks, both in terms of accuracy (around 50% improvement) and processing time (around 52% improvement). A user experience study conducted with the help of 30 researchers reveals that the researchers found this system to be very helpful. As an additional objective, we discuss two novel use cases including automatically extracting links to public datasets from the proceedings, which would further accelerate the advancement in digital libraries. The result of the framework can be exported as a whole into structured TEI-encoded documents. Our framework is accessible online at http://cnergres.iitkgp.ac.in/OCR++/home/.

研究动机与目标

  • 开发一个稳健的开源框架,即使在存在OCR错误和多种格式风格的情况下,也能从学术文章中提取结构化信息。
  • 在现有最先进水平之上,进一步提升结构信息提取能力,如章节标题、表格和图表的识别。
  • 从PDF中准确提取元数据(标题、作者、电子邮箱)和参考文献信息(引用和参考文献条目)。
  • 支持新型应用场景,例如从自然语言处理会议论文集中自动提取公开数据集链接。
  • 将结果以标准化的TEI编码文档形式导出,以支持数字图书馆中的互操作性。

提出的方法

  • 使用 pdf2xml 将输入PDF转换为富含元数据的XML,保留空间和排版信息,如x/y坐标、字体大小和粗体属性。
  • 通过空间距离和排版差异(如字体大小、粗体)将文本分割为逻辑块,以识别结构单元。
  • 使用相对位置、字体大小、大小写和粗体等特征,在标注训练样本(标题6,300个,作者姓名6,300个)上训练CRF模型。
  • 应用手工编写的规则和启发式方法,以区分作者姓名(例如,y坐标差异、制表符分隔),并检测电子邮件模式(如@、.com)。
  • 使用基于规则的消歧方法处理引用实例,并利用位置和句法线索将引用映射到参考文献条目。
  • 将特定章节名称(如“Introduction”、“Methodology”)映射到通用类别(如“Background”、“Method”),以支持按章节的引用分布分析。

实验结果

研究问题

  • RQ1结合CRF模型与手工规则的混合框架,是否能在学术文章的结构信息提取中超越纯机器学习方法?
  • RQ2在不同出版商之间通用的格式模式在多大程度上可被利用,以提升受OCR错误影响文档的鲁棒性?
  • RQ3OCR++在元数据、结构和参考文献提取任务中,与最先进工具相比表现如何?
  • RQ4OCR++能否实现新型应用场景,如从会议论文集中自动提取公开数据集链接?
  • RQ5版式和排版特征对学术PDF中信息提取准确率有何影响?

主要发现

  • 与最先进系统相比,OCR++在准确率上平均提升50%,处理时间减少52%,尤其在结构信息提取方面表现突出。
  • 该框架在提取章节标题、表格和图表标签、脚注以及URL方面优于现有工具,表现出对OCR错误的更强鲁棒性。
  • 对30名研究人员进行的用户体验研究证实,OCR++在学术信息提取任务中被广泛认为极具帮助。
  • 该系统成功从ACL文集论文中提取了公开数据集链接,为数字图书馆增强开辟了新应用场景。
  • 该框架可将特定章节名称(如“Methodology”)映射到通用类别(如“Method”),从而支持按章节的引用分布分析。
  • 尽管pdf2xml存在OCR错误和非英文字符的限制,OCR++仍通过基于规则的过滤和上下文启发式方法保持了高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。