Skip to main content
QUICK REVIEW

[논문 리뷰] Patent sentiment analysis to highlight patent paragraphs

Markus Endres, Renukswamy Chikkamath|OPUS (Augsburg University)|2021. 11. 23.
Intellectual Property and Patents인용 수 5
한 줄 요약

이 논문은 심사관과 변호사들이 기술적 청구항, 문제, 이점 등을 수동으로 강조하는 데 소요되는 시간을 줄이기 위해 감성 유형(예: 기술적 문제, 이점, 보일러플레이트)으로 레이블링된 150만 개의 특허 문단을 포함하는 새로운 다중 클래스 데이터셋을 제안한다. 탐색적 데이터 분석과 LSVC와 같은 베이스라인 기계학습 모델을 사용하여 핵심 클래스에서 최대 97%의 F1 스코어를 달성하였으며, 향후 특허 정보 검색 분야의 딥러닝 및 도메인 특화 NLP 기술 발전을 가능하게 하기 위해 코드와 데이터를 오픈소스로 제공한다.

ABSTRACT

Given a patent document, identifying distinct semantic annotations is an interesting research aspect. Text annotation helps the patent practitioners such as examiners and patent attorneys to quickly identify the key arguments of any invention, successively providing a timely marking of a patent text. In the process of manual patent analysis, to attain better readability, recognising the semantic information by marking paragraphs is in practice. This semantic annotation process is laborious and time-consuming. To alleviate such a problem, we proposed a novel dataset to train Machine Learning algorithms to automate the highlighting process. The contributions of this work are: i) we developed a multi-class, novel dataset of size 150k samples by traversing USPTO patents over a decade, ii) articulated statistics and distributions of data using imperative exploratory data analysis, iii) baseline Machine Learning models are developed to utilize the dataset to address patent paragraph highlighting task, iv) dataset and codes relating to this task are open-sourced through a dedicated GIT web page: https://github.com/Renuk9390/Patent_Sentiment_Analysis and v) future path to extend this work using Deep Learning and domain specific pre-trained language models to develop a tool to highlight is provided. This work assist patent practitioners in highlighting semantic information automatically and aid to create a sustainable and efficient patent analysis using the aptitude of Machine Learning.

연구 동기 및 목표

  • 심사관과 변호사들이 특허 문서의 핵심 기술적 문단을 수동으로 강조하는 데 소요되는 시간을 줄이기 위해 자동화된 프로세스를 제공하는 것.
  • 기술적 문제, 이점, 보일러플레이트와 같은 의미적 레이블이 부여된 특허 텍스트 세그먼트로 구성된 대규모 다중 클래스 데이터셋을 개발하는 것.
  • 의미적으로 중요한 특허 내용을 식별하고 강조할 수 있도록 특허 감성 분석을 위한 기초 기계학습 모델을 수립하는 것.
  • 데이터셋, 데이터 수집 파이프라인, 모델 코드를 오픈소스로 제공하여 특허 정보 검색 및 NLP 분야의 연구를 가속화하는 것.
  • 향후 딥러닝 및 도메인 특화 미리 학습된 언어 모델의 통합을 위한 기반을 마련하는 것.

제안 방법

  • 10년간의 USPTO 전체 텍스트 특허 출원 자료를 XML 파싱을 통해 순회하여 15만 개의 특허 문단 샘플로 구성된 다중 클래스 데이터셋을 구축하였다.
  • 레이블 분포, 시퀀스 길이, n-그램 빈도(일반 및 이중 그램)를 분석하기 위해 광범위한 탐색적 데이터 분석을 수행하였다.
  • 다섯 가지 기초 기계학습 모델(Naive Bayes(NBSVM), Logistic Regression(LR), Linear SVM(LSVC), Multinomial Naive Bayes(MNB), Random Forest(RF))을 훈련하고 평가하였다.
  • 모델 성능 평가를 위해 5겹 교차검증을 사용하였으며, 분류 결정에 대한 단어 수준 기여도를 시각화하기 위해 LIME 해석 도구를 적용하였다.
  • LIME를 통한 모델 해석 기능을 통합하여 각 레이블(예: 중립, 부정, 긍정)에 대해 예측에 가장 강하게 기여한 단어를 강조 표시하였다.
  • 공개된 GitHub 리포지토리(https://github.com/Renuk9390/Patent_Sentiment_Analysis)를 통해 데이터셋과 코드베이스를 커뮤니티가 재사용하고 확장할 수 있도록 배포하였다.

실험 결과

연구 질문

  • RQ1USPTO 출원 자료에서 체계적으로 15만 개의 특허 문단으로 구성된 대규모 다중 클래스 데이터셋을 구축할 수 있는가?
  • RQ2표준 기계학습 모델은 기술적 문제, 이점, 보일러플레이트와 같은 의미적 카테고리로 특허 문단을 분류하는 데 얼마나 잘 성능을 내는가?
  • RQ3특허 텍스트에서 지배적인 언어 패턴과 레이블 분포는 모델 설계 및 데이터 수집에 어떤 영향을 미칠 수 있는가?
  • RQ4LIME와 같은 해석 도구는 특허 감성 분류에서 모델 결정을 이해하는 데 연구자와 전문가가 얼마나 도움이 되는가?
  • RQ5데이터셋과 코드를 오픈소스로 제공하면 향후 특허 정보 검색 및 지적재산 분석을 위한 딥러닝 연구가 얼마나 가속화될 수 있는가?

주요 결과

  • LSVC 모델은 모든 클래스에서 최고의 F1 스코어 96%를 기록하였으며, 클래스 0에선 96%, 클래스 1에선 95%, 클래스 2에선 97%의 F1 스코어를 기록하였다.
  • NBSVM 모델은 클래스 2에 대해 97%의 높은 F1 스코어를 기록하여 '이점' 카테고리에서 뛰어난 성능을 보였다.
  • 데이터셋은 세 가지 주요 의미적 클래스에 균형 잡힌 표현을 가진 15만 개의 레이블링된 샘플을 포함하여 강력한 모델 훈련을 지원한다.
  • 탐색적 분석 결과, 유니그램과 바이그램에 대해 각각 훈련 세트와 테스트 세트의 평균 시퀀스 길이가 약 307 및 599 토큰으로 확인되었다.
  • LSVC의 혼동 행렬은 높은 클래스 간 분리도를 보이며, 낮은 오분류율을 보이는 신뢰할 수 있는 모델 예측을 의미한다.
  • LIME 시각화 결과, 'improves'(향상시킨다), 'provides'(제공한다), 'problem'(문제)와 같은 단어들이 특정 레이블에 대해 강력한 예측 요소로 작용함을 확인하여 모델의 해석 가능성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.