Skip to main content
QUICK REVIEW

[논문 리뷰] BERT-CNN: a Hierarchical Patent Classifier Based on a Pre-Trained Language Model

Xiaolei Lu, Bin Ni|arXiv (Cornell University)|2019. 11. 03.
Intellectual Property and Patents참고 문헌 11인용 수 7
한 줄 요약

이 논문은 BERT의 문맥 임베딩과 CNN을 조합한 계층적 특허 분류기인 BERT-CNN을 제안한다. 중국 국가 특허 데이터로 훈련된 BERT-CNN은 84.3%의 정확도를 기록하며, CNN 및 RNN 기반 모델보다 유의하게 뛰어나며, 의미적 표현과 특허 분류 효율성에서 최신 기술 수준의 성능을 입증한다.

ABSTRACT

The automatic classification is a process of automatically assigning text documents to predefined categories. An accurate automatic patent classifier is crucial to patent inventors and patent examiners in terms of intellectual property protection, patent management, and patent information retrieval. We present BERT-CNN, a hierarchical patent classifier based on pre-trained language model by training the national patent application documents collected from the State Information Center, China. The experimental results show that BERT-CNN achieves 84.3% accuracy, which is far better than the two compared baseline methods, Convolutional Neural Networks and Recurrent Neural Networks. We didn't apply our model to the third and fourth hierarchical level of the International Patent Classification - "subclass" and "group".The visualization of the Attention Mechanism shows that BERT-CNN obtains new state-of-the-art results in representing vocabularies and semantics. This article demonstrates the practicality and effectiveness of BERT-CNN in the field of automatic patent classification.

연구 동기 및 목표

  • 지적 재산권 관리 및 검색 향상을 위해 정확한 자동 특허 분류 시스템을 개발하기 위해.
  • BERT와 같은 사전 훈련된 언어 모델을 활용하여 특허 텍스트 분류에서 의미적 표현을 향상시키기 위해.
  • 국제 특허 분류(IPC) 체계의 구조에 맞게 설계된 계층적 분류 프레임워크를 설계하기 위해.
  • 주의 메커니즘이 특허의 관련 특징을 효과적으로 포착하는지 평가하기 위해.
  • 딥 러닝 모델이 실제 특허 분류 작업에서 실용적으로 유용한지 입증하기 위해.

제안 방법

  • 국가정보센터에서 확보한 대규모 중국 국가 특허 데이터셋을 기반으로 BERT를 미세조정한다.
  • 1D 컨volutional 신경망(CNN)을 사용하여 BERT 임bedded 시퀀스에서 국소적 텍스트 특징을 추출한다.
  • 특허 문서를 IPC 분류 체계의 첫 번째 및 두 번째 수준에서 처리하는 계층적 분류 아키텍처를 구현한다.
  • 특허의 청구항에서 의미적으로 중요한 단어와 구를 강조하기 위해 주의 메커니즘을 적용한다.
  • Adam 최적화를 사용하여 교차 엔트로피 손실을 기반으로 종단 간 모델을 훈련한다.
  • 주의 가중치를 시각화하여 모델 결정의 해석 가능성을 검토하고 의미적 표현 품질을 검증한다.

실험 결과

연구 질문

  • RQ1단독으로 사용되는 CNN 및 RNN 모델보다 BERT-CNN 하이브리드 모델이 특허 분류에서 뛰어난 성능을 내는가?
  • RQ2주의 메커니즘이 특허 텍스트의 관련 의미적 특징을 얼마나 효과적으로 포착하는가?
  • RQ3사전 훈련된 언어 표현과 CNN을 조합함으로써 계층적 특허 데이터에서 분류 정확도가 향상되는가?
  • RQ4모델이 IPC 계층의 첫 번째 및 두 번째 수준으로 일반화되는 정도는 어느 정도인가?
  • RQ5모델의 주의 패턴이 특허 문서의 의미적 관련성을 의미적으로 해석할 수 있는가?

주요 결과

  • BERT-CNN은 IPC의 첫 번째 및 두 번째 수준에서 84.3%의 분류 정확도를 기록하며, CNN 및 RNN 기반 모델보다 유의미하게 뛰어나다.
  • 모델은 특허 텍스트의 의미적 및 어휘적 특징을 표현하는 데 최신 기술 수준의 성능를 보여준다.
  • 주의 시각화 결과는 모델이 핵심 기술 용어와 청구 항목 요소에 집중하고 있음을 확인하며, 이는 모델의 해석 가능성 향상에 기여한다.
  • 계층적 설계는 IPC 분류 체계 내의 구조적 관계를 효과적으로 포착한다.
  • 모델은 세 번째 및 네 번째 수준(하위분류 및 그룹)에는 확장되지 않아 최상위 수준 분류에 국한된다.
  • 결과는 BERT-CNN이 실제 특허 정보 검색 및 관리 작업에서 실용적이고 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.