Skip to main content
QUICK REVIEW

[논문 리뷰] The Harvard USPTO Patent Dataset: A Large-Scale, Well-Structured, and Multi-Purpose Corpus of Patent Applications

Mirac Süzgün, Luke Melas-Kyriazi|arXiv (Cornell University)|2022. 07. 08.
Intellectual Property and Patents인용 수 14
한 줄 요약

하버드 USPTO 특허 데이터셋(HUPD)은 2004년에서 2018년 사이에 제출된 450만 개 이상의 영어 특허 출원서를 포함한 대규모이고 체계적인 코퍼스로, 승인된 특허가 아닌 발명자가 제출한 버전을 포함한다. 이 데이터셋은 이진 분류, 다중 분류 주제 분류, 언어 모델링, 요약 등의 새로운 NLP 작업을 가능하게 하며, 풍부한 구조화된 메타데이터와 정밀하게 튜닝된 트랜스포머 모델을 활용해 시간에 따른 개념 이동과 의미적 진화를 연구할 수 있다.

ABSTRACT

Innovation is a major driver of economic and social development, and information about many kinds of innovation is embedded in semi-structured data from patents and patent applications. Although the impact and novelty of innovations expressed in patent data are difficult to measure through traditional means, ML offers a promising set of techniques for evaluating novelty, summarizing contributions, and embedding semantics. In this paper, we introduce the Harvard USPTO Patent Dataset (HUPD), a large-scale, well-structured, and multi-purpose corpus of English-language patent applications filed to the United States Patent and Trademark Office (USPTO) between 2004 and 2018. With more than 4.5 million patent documents, HUPD is two to three times larger than comparable corpora. Unlike previously proposed patent datasets in NLP, HUPD contains the inventor-submitted versions of patent applications--not the final versions of granted patents--thereby allowing us to study patentability at the time of filing using NLP methods for the first time. It is also novel in its inclusion of rich structured metadata alongside the text of patent filings: By providing each application's metadata along with all of its text fields, the dataset enables researchers to perform new sets of NLP tasks that leverage variation in structured covariates. As a case study on the types of research HUPD makes possible, we introduce a new task to the NLP community--namely, binary classification of patent decisions. We additionally show the structured metadata provided in the dataset enables us to conduct explicit studies of concept shifts for this task. Finally, we demonstrate how HUPD can be used for three additional tasks: multi-class classification of patent subject areas, language modeling, and summarization.

연구 동기 및 목표

  • NLP 분야에서 대규모, 체계적이고 다목적 특허 코퍼스의 부족을 해결하기 위해 특허 출원의 전 과정을 다루는 공개 데이터셋을 구축한다.
  • 발행 이전 버전의 특허 출원서에 대한 접근을 제공함으로써 새로운 NLP 연구를 가능하게 한다. 이는 발명자가 제출한 원본 청구항과 설명서를 포함한다.
  • 34개의 구조화된 메타데이터 필드(예: 출원일, 심사관, IPC 코드)를 전체 텍스트 내용과 통합함으로써 다중 작업 NLP 연구를 지원한다.
  • 정밀하게 튜닝된 트랜스포머 모델을 활용해 기술 분야 간 특허 언어와 기술 카테고리의 시간에 따른 개념 이동과 진화를 연구할 수 있도록 한다.
  • 독립 발명가와 소규모 기업이 HUPD를 기반으로 한 NLP 도구를 통해 특허 출원 품질을 향상시킬 수 있도록 지원한다.

제안 방법

  • 데이터셋은 원시 USPTO 공개 데이터에서 유래하였으며, 특허 출원서 34개 필드(제목, 초록, 청구항, 설명, 출원일, 심사관, IPC 분류 코드 등)를 추출하고 체계화하였다.
  • 텍스트 필드는 일관성을 확보하기 위해 사전 처리 및 정규화되었으며, 모든 데이터는 2004년에서 2018년 사이에 제출된 실용특허 출원서의 발행 이전 버전에서 유래하였다.
  • 다음 NLP 작업을 위한 맥락적 임베딩을 생성하기 위해 정밀하게 튜닝된 트랜스포머 모델(DistilRoBERTa, T5-Small 등)을 데이터셋에 대해 훈련시켰다.
  • 차원 감소 기법(PCA 및 UMAP)을 적용하여 임베딩 벡터를 시각화함으로써 기술 분야 간 특허 언어의 의미 클러스터링과 시간적 이동을 분석하였다.
  • 출원 시점의 텍스트와 메타데이터를 입력 특징으로 사용하여 특허 승인이 이루어질 가능성을 예측하는 새로운 이진 분류 작업을 도입하였다.
  • HUPD에 대해 미세조정된 모델을 활용해 IPC 코드를 이용한 다중 분류, 언어 모델링, 개괄적 요약 등 다양한 NLP 작업을 지원한다.

실험 결과

연구 질문

  • RQ1NLP 모델은 출원 시점의 발행 이전 텍스트와 메타데이터만으로 특허 출원이 승인될지를 정확히 예측할 수 있는가?
  • RQ2특허 언어의 의미 표현은 시간에 따라 어떻게 변화하는가? 임베딩 공간에서 개념 이동의 증거는 무엇인가?
  • RQ3구조화된 메타데이터(예: 심사관, IPC 코드)가 특허 분류 및 배정 예측 등의 NLP 작업 성능에 어느 정도 기여하는가?
  • RQ4정밀하게 튜닝된 트랜스포머 모델은 다양한 기술 분야의 특허 출원서의 의미 다양성을 효과적으로 포착하고 표현할 수 있는가?
  • RQ5풍부한 메타데이터와 전체 텍스트 데이터의 통합은 특허 출원 품질 향상과 접근성 향상에 새로운 NLP 응용을 가능하게 하는가?

주요 결과

  • HUPD는 2004년에서 2018년 사이에 제출된 450만 개 이상의 영어 특허 출원서를 포함하고 있어, 이전의 NLP 특허 데이터셋보다 두 배에서 세 배 정도 크다.
  • 각 출원서에 대해 34개의 구조화된 데이터 필드를 포함하여, 텍스트 외에도 시간적, 심사관 기반의 변동성 연구 등 다각도 분석이 가능하다.
  • 정밀하게 튜닝된 트랜스포머 모델(DistilRoBERTa, T5-Small 등)은 임베딩 공간에서 유사한 IPC 카테고리가 서로 가까이 그룹화되는 의미적 클러스터링을 생성한다.
  • UMAP를 활용한 시각화 결과, G06Q(데이터 처리 시스템) 분야의 의미 표현은 시간이 지남에 따라 H04L 및 H04W(통신 시스템)와 더 가까워졌으며, 이는 기술 융합과 일치하는 공변량 이동을 나타낸다.
  • 텍스트와 메타데이터 특징을 결합함으로써 성능 향상을 이룬 출원 승인 결과 예측을 위한 새로운 이진 분류 작업이 가능해졌다.
  • 발행 이전 버전이 포함되어 있어 연구자들이 출원 시점의 특허성과 혁신 품질을 검토할 수 있으며, 승후 수정으로 인한 편향을 피할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.