[论文解读] PatentMatch: A Dataset for Matching Patent Claims & Prior Art.
PatentMatch 是一个大规模、由专家标注的数据集,将专利权利要求与欧洲专利局(EPO)检索报告中语义匹配的现有技术段落配对。该数据集支持专利现有技术检索模型的监督训练,初步的基于 BERT 的实验显示出中等性能(准确率为 52–54%),凸显了在专利用语中进行语义匹配的挑战。
Patent examiners need to solve a complex information retrieval task when they assess the novelty and inventive step of claims made in a patent application. Given a claim, they search for prior art, which comprises all relevant publicly available information. This time-consuming task requires a deep understanding of the respective technical domain and the patent-domain-specific language. For these reasons, we address the computer-assisted search for prior art by creating a training dataset for supervised machine learning called PatentMatch. It contains pairs of claims from patent applications and semantically corresponding text passages of different degrees from cited patent documents. Each pair has been labeled by technically-skilled patent examiners from the European Patent Office. Accordingly, the label indicates the degree of semantic correspondence (matching), i.e., whether the text passage is prejudicial to the novelty of the claimed invention or not. Preliminary experiments using a baseline system show that PatentMatch can indeed be used for training a binary text pair classifier on this challenging information retrieval task. The dataset is available online: https://hpi.de/naumann/s/patentmatch.
研究动机与目标
- 为解决专利审查中自动化现有技术检索的挑战,该任务需要深入的技术与法律领域知识。
- 提供一个高质量、由专家标注的数据集,用于训练专利相关信息检索中的监督机器学习模型。
- 支持开发能够以高精度协助专利审查员识别破坏新颖性的现有技术的 AI 系统。
- 支持对 EPO 中专家检索行为及检索报告生成过程的系统性分析。
- 促进在半自动化段落检索和利用学习模型改进检索查询策略方面的研究。
提出的方法
- 该数据集源自 EPO 检索报告,其中明确标注了每项权利要求相关的现有技术段落。
- 每个数据点由一项专利权利要求和一份引用的现有技术文件中的文本段落组成,由 EPO 审查员标注为 'X'(破坏新颖性)或 'A'(背景技术,不破坏新颖性或显而易见性)。
- 该数据集包含真实专利申请和授权专利中的权利要求与段落,训练集与测试集按申请日期分离,以确保时间有效性。
- 在数据集上微调了一个基于 BERT 的文本对分类基线模型,以预测段落是否作为 'X' 或 'A' 文档与权利要求匹配。
- 该模型使用 BERT-base-uncased 架构的 [CLS] 标记表示,以分类权利要求与段落之间的语义对应关系。
- 实验使用 FARM 框架,并在平衡数据与单次引用数据变体上评估性能,以评估模型的泛化能力与鲁棒性。
实验结果
研究问题
- RQ1监督机器学习模型能否有效学习识别破坏专利权利要求新颖性的现有技术段落?
- RQ2像 BERT 这类预训练 Transformer 模型在专利特定语言中的复杂语义匹配任务中,其性能如何泛化?
- RQ3来自 EPO 检索报告的专家标注数据在多大程度上能提升现有技术检索系统的精度?
- RQ4在将专利权利要求与相关现有技术段落匹配时,关键的语言与结构挑战是什么,它们如何影响模型性能?
- RQ5学习到的模型在多大程度上能帮助改进或适应专利审查员用于提高现有技术检索召回率的手动关键词查询?
主要发现
- PatentMatch 数据集为训练和评估专利现有技术检索模型提供了大规模、由专家标注的资源,权利要求与现有技术段落通过 EPO 检索报告建立关联。
- 初步实验使用微调后的 BERT 模型在平衡数据划分上的测试集准确率达到 54%,表明该任务仍极具挑战性。
- 在更受限的数据划分(每项权利要求恰好对应一个 'X' 和一个 'A' 文档)上,模型准确率为 52%,表明在数据变化极小时性能提升有限。
- 验证损失在仅 6 个训练周期后即趋于平稳,表明收敛缓慢,且从专利文本中复杂语言模式学习具有困难。
- 与随机猜测相比,准确率仍较低,凸显了即使在最先进模型下,专利特定法律与技术语言中的语义匹配依然极具挑战。
- 该数据集为未来研究专家检索行为、遗漏的相关参考文献,以及将学习模型与手动查询策略结合提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。