Skip to main content
QUICK REVIEW

[论文解读] BERT-CNN: a Hierarchical Patent Classifier Based on a Pre-Trained Language Model

Xiaolei Lu, Bin Ni|arXiv (Cornell University)|Nov 3, 2019
Intellectual Property and Patents参考文献 11被引用 7
一句话总结

本文提出 BERT-CNN,一种结合 BERT 上下文嵌入与卷积神经网络(CNN)的分层专利分类模型,用于专利文档分类。在中文国家专利数据集上进行训练,准确率达到 84.3%,显著优于 CNN 和 RNN 基线模型,展示了在语义表征与专利分类有效性方面的最先进性能。

ABSTRACT

The automatic classification is a process of automatically assigning text documents to predefined categories. An accurate automatic patent classifier is crucial to patent inventors and patent examiners in terms of intellectual property protection, patent management, and patent information retrieval. We present BERT-CNN, a hierarchical patent classifier based on pre-trained language model by training the national patent application documents collected from the State Information Center, China. The experimental results show that BERT-CNN achieves 84.3% accuracy, which is far better than the two compared baseline methods, Convolutional Neural Networks and Recurrent Neural Networks. We didn't apply our model to the third and fourth hierarchical level of the International Patent Classification - "subclass" and "group".The visualization of the Attention Mechanism shows that BERT-CNN obtains new state-of-the-art results in representing vocabularies and semantics. This article demonstrates the practicality and effectiveness of BERT-CNN in the field of automatic patent classification.

研究动机与目标

  • 开发一种高精度的自动专利分类系统,以提升知识产权管理与检索效率。
  • 利用 BERT 等预训练语言模型增强专利文本分类中的语义表征能力。
  • 设计一种针对国际专利分类(IPC)结构的分层分类框架。
  • 评估注意力机制在捕捉相关专利特征方面的有效性。
  • 展示深度学习模型在真实世界专利分类任务中的实际应用价值。

提出的方法

  • 在国家信息中心收集的大规模中文国家专利数据集上微调 BERT 模型。
  • 使用一维卷积神经网络(1D CNN)从 BERT 嵌入序列中提取局部文本特征。
  • 实现一种分层分类架构,对国际专利分类(IPC)分类体系的第一级和第二级进行处理。
  • 应用注意力机制突出专利权利要求中的语义重要词汇与短语。
  • 使用交叉熵损失与 Adam 优化器端到端训练模型。
  • 可视化注意力权重,以解释模型决策并验证语义表征质量。

实验结果

研究问题

  • RQ1与独立的 CNN 和 RNN 模型相比,BERT-CNN 混合模型是否能在专利分类中实现更优性能?
  • RQ2注意力机制在捕捉专利文本中相关语义特征方面的有效性如何?
  • RQ3将预训练语言表示与 CNN 结合是否能提升分层专利数据的分类准确率?
  • RQ4该模型在 IPC 分类体系的第一级和第二级上的泛化能力如何?
  • RQ5模型的注意力模式是否可被有意义地解释,以反映专利文档中的语义相关性?

主要发现

  • BERT-CNN 在 IPC 的第一级与第二级分类上达到 84.3% 的分类准确率,显著优于 CNN 和 RNN 基线模型。
  • 该模型在表征专利文本中的语义与词汇特征方面达到最先进水平。
  • 注意力可视化结果表明,模型聚焦于关键技术术语与权利要求要素,提升了可解释性。
  • 分层设计有效捕捉了 IPC 分类体系内部的结构关系。
  • 该模型未扩展至第三级与第四级(子类与组),因此其应用范围限于顶层分类。
  • 结果验证了 BERT-CNN 在真实世界专利信息检索与管理中的实用性和有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。