[论文解读] S2ORC: The Semantic Scholar Open Research Corpus
S2ORC 引入了迄今为止最大规模的、公开可获取的、机器可读的英文学术论文语料库,涵盖8110万篇论文,整合了来自不同出版商和档案库的结构化全文、元数据及参考文献。该语料库通过链接的引用、图表、表格和公式,提供丰富标注的全文数据,显著扩展了以往语料库的覆盖范围和结构复杂性。
We introduce S2ORC, a large corpus of 81.1M English-language academic papers spanning many academic disciplines. The corpus consists of rich metadata, paper abstracts, resolved bibliographic references, as well as structured full text for 8.1M open access papers. Full text is annotated with automatically-detected inline mentions of citations, figures, and tables, each linked to their corresponding paper objects. In S2ORC, we aggregate papers from hundreds of academic publishers and digital archives into a unified source, and create the largest publicly-available collection of machine-readable academic text to date. We hope this resource will facilitate research and development of tools and tasks for text mining over academic text.
研究动机与目标
- 创建涵盖多个学科的、最大规模的、公开可获取的、机器可读的学术论文语料库。
- 将来自数百家出版商和档案库的全文学术论文汇聚并统一为一个一致且可访问的资源。
- 提供结构化、带标注的全文,包含内联引用、图表/表格引用以及链接的书目元数据,以增强 NLP 和文本挖掘应用。
- 通过包含全文解析、引用链接以及对多样化学术领域的支持,提升现有学术文本语料库的质量与覆盖范围。
提出的方法
- 从可信出版商、数字档案库(如 arXiv、PubMed Central)和机构存储库中聚合了 8110 万篇英文学术论文。
- 使用 Grobid 和 pdfalto 从 810 万篇开放获取 PDF 中提取并结构化全文,保留段落分隔、章节标题和内联注释。
- 自动检测并链接内联引用、图表引用、表格引用和公式,使其与对应的书目条目和对象相连接。
- 通过将所有引用链接至 Semantic Scholar 文献图谱中的 8110 万个论文节点,构建统一的引用图。
- 提供一个独立的 LaTeX 解析子集(150 万篇论文),以恢复额外的结构信息,包括数学公式和表格内容。
- 在处理前应用过滤启发式规则,排除低质量或非论文类 PDF(如超过 50 页、幻灯片、解析错误等)。
实验结果
研究问题
- RQ1如何从多样化来源构建一个大规模、统一且机器可读的学术论文语料库,实现一致的结构与元数据?
- RQ2S2ORC 在全文覆盖范围、结构丰富度和跨学科多样性方面,相较于现有语料库的提升程度如何?
- RQ3在全文中包含结构化内容(如链接的引用、图表和表格)是否能显著提升下游 NLP 任务(如引用链接或话语分析)的性能?
- RQ4在保留预印本与正式发表版本之间论文原始身份方面,标准论文聚类方法的可靠性如何?
- RQ5与其它预训练语料库相比,基于 S2ORC 训练 BERT 模型对学术 NLP 任务的影响如何?
主要发现
- S2ORC 包含 8110 万个论文节点,其中 810 万篇论文的全文内容已从 PDF 中提取并结构化。
- 该语料库涵盖的学术学科范围超过任何其他公开可用语料库,包括计算机科学、物理学、数学和生物医学文献。
- S2ORC 提供全文解析,内联引用、图表和表格引用均链接至其对应对象和书目条目。
- LaTeX 解析子集(150 万篇论文)恢复了额外的结构元素,如公式和表格内容,优于先前的语料库(如 Saier 和 Färber, 2019)。
- S2ORC 的全文论文数量是 PubMed Central (OA) 的三倍以上,后者是第二大具备计量指标增强的语料库。
- 评估显示论文聚类具有高准确性,98.5% 的标准标题和 97.2% 的作者列表与 PDF 中的内容在可接受差异范围内匹配(如大小写、特殊字符、缩写等)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。