[论文解读] Improving reference mining in patents with BERT
本论文通过在优化后的数据集上应用基于 BERT 的模型(BERT、BioBERT、SciBERT),改进了专利引用挖掘,交叉验证中召回率达到 97%,并提取了比以往方法多 50% 的引用——总计 735,000 条。该方法结合了增强的训练数据与迁移学习的序列标注,无论在内在评估还是外在评估中,其表现均显著优于 CRF 和 Flair,在大规模专利语料库中表现突出。
In this paper we address the challenge of extracting scientific references from patents. We approach the problem as a sequence labelling task and investigate the merits of BERT models to the extraction of these long sequences. References in patents to scientific literature are relevant to study the connection between science and industry. Most prior work only uses the front-page citations for this analysis, which are provided in the metadata of patent archives. In this paper we build on prior work using Conditional Random Fields (CRF) and Flair for reference extraction. We improve the quality of the training data and train three BERT-based models on the labelled data (BERT, bioBERT, sciBERT). We find that the improved training data leads to a large improvement in the quality of the trained models. In addition, the BERT models beat CRF and Flair, with recall scores around 97% obtained with cross validation. With the best model we label a large collection of 33 thousand patents, extract the citations, and match them to publications in the Web of Science database. We extract 50% more references than with the old training data and methods: 735 thousand references in total. With these patent-publication links, follow-up research will further analyze which types of scientific work lead to inventions.
研究动机与目标
- 提高从专利中提取正文引用的准确率和召回率,因为这些引用常被忽视,相较于首页引用而言。
- 通过迭代式模型分析识别并修正标注和预处理错误,解决先前数据集的局限性。
- 评估基于 BERT 的模型(BERT、BioBERT、SciBERT)在专利引用挖掘的序列标注任务中相较于 CRF 和 Flair 的有效性。
- 通过将最佳性能模型应用于 33,338 个未标注的生物技术专利,实现大规模专利-出版物链接的提取。
- 分析 BERT 和 CRF 模型中的错误模式,以理解其对后续引用解析与匹配的影响。
提出的方法
- 本研究通过模型预测与人工检查,重新评估并修正了先前 22 个专利数据集中的标注错误,从而获得更高质量的训练集。
- 使用 IOB 标注对三种基于 BERT 的模型(BERT、BioBERT、SciBERT)进行微调,以实现专利文本中引用范围的序列标注识别。
- 在优化后的数据集上采用留一法交叉验证进行模型训练与评估,报告了精确率、召回率和 F1 分数。
- 将性能最佳的模型(SciBERT)应用于包含 33,338 个 USPTO 生物技术专利的大型未标注语料库,以提取正文引用。
- 将提取的引用与 Web of Science 数据库进行匹配,以评估外在性能,优先考虑召回率而非精确率。
- 通过分析 'O' 预测在引用范围内的相对位置,对比 BERT 与 CRF 模型,以理解错误模式的结构性差异。
实验结果
研究问题
- RQ1与 CRF 和 Flair 相比,基于 BERT 的模型是否能显著提升专利中正文引用提取的召回率?
- RQ2提升训练数据质量对引用挖掘中模型性能有何影响?
- RQ3基于 BERT 的模型与 CRF 在序列标注用于引用提取时,其错误模式有何不同?
- RQ4当应用于大规模未标注专利语料库时,BERT 模型相较于先前方法的性能提升程度如何?
- RQ5改进后的模型是否能提取比以往方法更多的专利-出版物链接?这是否有助于提升对科技-产业知识流动的分析?
主要发现
- 优化后的训练数据显著提升了模型性能,基于 BERT 的模型在交叉验证中达到 97% 的召回率,显著优于 CRF 和 Flair。
- 最佳模型(SciBERT)从未标注的 33,338 个专利中提取了 735,000 个正文引用,比以往方法多出 50%。
- BERT 模型的错误序列更少且更短(中位长度为 1–2),而 CRF 模型的错误序列更长(中位长度为 4),且错误在引用中分布更不均匀。
- CRF 模型由于在处理长序列时存在结构性限制,更容易遗漏整个引用段落,尤其是在中间位置。
- 尽管内在评估得分相似,BERT 模型在外部评估中表现出更高的召回率和更优性能,表明其在真实世界数据中具有更强的泛化能力。
- 错误分析显示,CRF 模型常在引用的开头或结尾处失败,而 BERT 模型更可能遗漏内部词元,表明其存在不同的失效模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。