[论文解读] A machine-compiled macroevolutionary history of Phanerozoic life
本文提出 PaleoDeepDive(PDD),一种机器阅读系统,可从科学文献中自动提取化石出现数据,在宏进化数据提取方面达到人类水平的准确度。该系统生成一个概率性、可扩展的数据库,支持对寒武纪以来生物多样性模式的大规模、可重现综合分析,包括从插图中提取形态学数据,其性能与人类整理的数据库(如古生物学数据库)相当。
Many aspects of macroevolutionary theory and our understanding of biotic responses to global environmental change derive from literature-based compilations of palaeontological data. Existing manually assembled databases are, however, incomplete and difficult to assess and enhance. Here, we develop and validate the quality of a machine reading system, PaleoDeepDive, that automatically locates and extracts data from heterogeneous text, tables, and figures in publications. PaleoDeepDive performs comparably to humans in complex data extraction and inference tasks and generates congruent synthetic macroevolutionary results. Unlike traditional databases, PaleoDeepDive produces a probabilistic database that systematically improves as information is added. We also show that the system can readily accommodate sophisticated data types, such as morphological data in biological illustrations and associated textual descriptions. Our machine reading approach to scientific data integration and synthesis brings within reach many questions that are currently underdetermined and does so in ways that may stimulate entirely new modes of inquiry.
研究动机与目标
- 测试机器阅读系统是否能够生成与人类整理数据库质量相当的宏进化数据。
- 通过自动化从大量科学文献中提取数据,提高古生物学数据整合的可扩展性并降低其成本。
- 开发一种能够处理复杂数据类型(如生物插图中的形态学测量值及其相关文本)的系统。
- 实现可重现的大规模化石数据综合,以支持假设检验和新的科学探究。
提出的方法
- PaleoDeepDive 使用 DeepDive 机器阅读基础架构,从非结构化科学文本、表格和图表中提取结构化数据。
- 通过概率建模,在关系(例如地质时代、地理位置、分类状态)之间进行联合推理,以提高精确率和召回率。
- 系统在包含超过 20000 万个随机变量和 3 亿个因子的大型因子图上执行吉布斯采样,以实现统计推断。
- 通过 NUMA 感知计算实现硬件效率,并通过无锁、并行的随机优化实现统计效率,以加快收敛速度。
- 整合光学字符识别(OCR)与自然语言理解技术,处理异构数据源,包括带标签的插图。
- 系统在少量标注数据上进行训练,并能泛化到新文献,实现对现有数据库的可扩展扩展。
实验结果
研究问题
- RQ1机器阅读系统能否以与人类整理数据库(如古生物学数据库)相当的质量提取化石出现数据?
- RQ2机器提取数据在重建寒武纪以来生物多样性曲线方面,与人工生成数据相比表现如何?
- RQ3该系统能否可靠地从生物插图及其文字描述中提取形态学数据(如体型大小估计值)?
- RQ4该系统在处理比当前人工整理多出数个数量级的文献方面,其可扩展性如何?
- RQ5在多个关系之间进行联合推理,是否能显著提升数据质量并减少复杂提取任务中的歧义?
主要发现
- PaleoDeepDive 达到了与人类专家相当的提取质量,其合成的生物多样性曲线在统计上与古生物学数据库推导出的曲线无法区分。
- 该系统生成了一个概率数据库,随着新数据的加入系统性地提升性能,支持可扩展且可重现的数据综合。
- 从插图中提取的机器推断体型大小估计值,在统计上与人类专家的手动测量结果无法区分。
- 该系统表现出高度可扩展性,其处理的文献数量比人工整理数据库多出一个数量级。
- 在多个关系之间进行联合推理显著提升了精确率和召回率,尤其是在利用层级关系(如时间周期的包含关系)时。
- 关闭联合推理规则对整体质量影响极小,表明系统在不同关系类型之间具有高度模块化和鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。