QUICK REVIEW
[论文解读] PMC text mining subset in BioC: 2.3 million full text articles and growing
Donald C. Comeau, Chih-Hsuan Wei|arXiv (Cornell University)|Apr 16, 2018
Biomedical Text Mining and Ontologies被引用 3
一句话总结
本文提出一个大规模、公开可访问的文本挖掘子集,包含从PubMed Central(PMC)获取的230万篇全文生物医学文章,已转换为BioC格式,便于高效的信息提取。该数据集可通过FTP和Web API获取,使研究人员能够轻松访问并分析带有结构化注释的全文文章,显著推动生物医学文本挖掘研究的发展。
ABSTRACT
Interest in full text mining biomedical research articles is growing. NCBI provides the PMC Open Access and Author Manuscript sets of articles which are available for text mining. We have made all of these articles available in BioC, an XML and JSON format which is convenient for sharing text, annotations, and relations. These articles are available both via ftp for bulk download and via a Web API for updates or more focused collection. Availability: https://www.ncbi.nlm.nih.gov/research/bionlp/APIs/BioC-PMC/
研究动机与目标
- 应对文本挖掘应用中对大规模、可访问的全文生物医学文章日益增长的需求。
- 提供一种标准化的机器可读格式(BioC),以简化研究社区间文本、注释和关系的共享。
- 通过可扩展的分发方式,实现对全文PMC开放获取和作者手稿集合的高效访问。
- 通过提供全面且最新的数据集,支持研究人员构建和训练文本挖掘系统。
- 通过支持批量下载和通过Web API的程序化访问,实现动态数据获取和更新。
提出的方法
- 从NCBI PMC开放获取和作者手稿集合中收集所有全文文章。
- 将每篇文章转换为BioC格式,该格式支持文本、注释和关系的结构化表示。
- 通过FTP提供数据集,支持批量下载,便于大规模离线处理。
- 实现Web API,以支持按需访问和增量更新,适用于聚焦或实时数据获取。
- 通过遵循既定的BioC标准,确保数据一致性和互操作性,适用于数字图书馆。
- 通过版本控制和元数据追踪,支持可重现性及长期可用性。
实验结果
研究问题
- RQ1如何以标准化、机器可读的格式高效地提供全文生物医学文章,以支持文本挖掘?
- RQ2哪些可扩展的分发机制最能支持多样化研究需求,从批量分析到实时数据访问?
- RQ3提供预转换、带注释的数据集在多大程度上降低了生物医学文本挖掘研究的入门门槛?
- RQ4将PMC文章集成到BioC格式在多大程度上提升了不同文本挖掘工具和系统之间的互操作性?
- RQ5在访问大规模生物医学文本数据集时,使用Web API与FTP在性能和可用性方面存在哪些权衡?
主要发现
- 该数据集包含230万篇全文生物医学文章,是生命科学领域最大型的公开可用文本挖掘资源之一。
- 整个集合均以BioC格式提供,支持对文本、注释和关系的结构化访问,便于后续分析。
- 该数据集通过FTP支持批量下载,同时通过Web API支持按需和增量访问。
- 以标准化格式提供该数据集,显著减少了为文本挖掘流程准备全文文章所需的工作量。
- 该数据集支持持续更新和扩展,确保其长期相关性和对不断演进的研究需求的适用性。
- 将PMC文章整合到BioC生态系统,增强了与现有文本挖掘工具和框架的互操作性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。