Skip to main content
QUICK REVIEW

[논문 리뷰] PatentTransformer-2: Controlling Patent Text Generation by Structural Metadata

Jieh-Sheng Lee, Jieh Hsiang|arXiv (Cornell University)|2020. 01. 11.
Topic Modeling참고 문헌 10인용 수 4
한 줄 요약

PatentTransformer-2는 제목, 초록, 독립 claim, 종속 claim 등의 특허 구성 요소 간 이중 방향 흐름을 통해 구조적 메타데이터를 기반으로 특허 텍스트 생성을 제어하는 구조적이고 메타데이터 기반의 접근 방식을 도입한다. GPT-2 기반 아키텍처를 종단 간 훈련하여 일관성과 제어 가능성을 향상시키며, 공개된 가중치와 코드를 통해 재현성과 증강된 발명 워크플로우 응용이 가능하다.

ABSTRACT

PatentTransformer is our codename for patent text generation based on Transformer-based models. Our goal is "Augmented Inventing." In this second version, we leverage more of the structural metadata in patents. The structural metadata includes patent title, abstract, and dependent claim, in addition to independent claim previously. Metadata controls what kind of patent text for the model to generate. Also, we leverage the relation between metadata to build a text-to-text generation flow, for example, from a few words to a title, the title to an abstract, the abstract to an independent claim, and the independent claim to multiple dependent claims. The text flow can go backward because the relation is trained bidirectionally. We release our GPT-2 models trained from scratch and our code for inference so that readers can verify and generate patent text on their own. As for generation quality, we measure it by both ROUGE and Google Universal Sentence Encoder.

연구 동기 및 목표

  • 제목, 초록, 청구항 등의 구조적 메타데이터를 제어 신호로 통합하여 특허 텍스트 생성을 향상시키기.
  • 고수준 메타데이터에서 상세한 청구항으로 향하는 흐름 기반의 이중 방향 생성 과정을 가능하게 하기.
  • 증강된 발명 및 특허 초안 작성 응용 분야에서 생성 품질과 제어 가능성을 향상시키기.
  • 재현성과 실용적 사용을 위해 훈련된 GPT-2 모델과 추론 코드를 공개하기.

제안 방법

  • 모델은 특허 데이터에 대해 미세조정된 트랜스포머 기반 아키텍처를 사용하며, 구조적 메타데이터를 입력 컨텍스트로 활용한다.
  • 텍스트에서 텍스트로의 생성 흐름을 설정: 제목 → 초록 → 독립 청구항 → 종속 청구항, 순방향 및 역방향 훈련을 통해 역방향 생성을 지원한다.
  • 구조적 메타데이터(제목, 초록, 청구항)를 조건부 신호로 사용하여 자동회귀 생성 과정을 안내한다.
  • 특허 문서에서 마스크된 언어 모델링을 사용한 시퀀스-투-시퀀스 목표로 사전 훈련 없이 끝에서부터 훈련한다.
  • 메타데이터 토큰에 조건을 두어 특허 초안의 다양한 단계에서 타겟 텍스트 합성을 제어한다.
  • 프레임워크는 순방향 및 역방향 생성을 모두 지원하여 특허 구성 요소의 반복적 개선을 가능하게 한다.

실험 결과

연구 질문

  • RQ1제목과 초록과 같은 구조적 메타데이터가 일관성 있고 관련성이 있는 특허 청구항 생성을 효과적으로 이끌 수 있는가?
  • RQ2특허 구성 요소 간 이중 방향 훈련이 생성 품질과 제어 가능성을 어떻게 향상시키는가?
  • RQ3GPT-2 기반 모델이 실제 세계의 특허 구조와 일관성을 충족하는 특허 텍스트를 얼마나 잘 생성할 수 있는가?
  • RQ4구조적 흐름을 사용하여 독립 청구항에서 종속 청구항을 고품질로 생성할 수 있는가?
  • RQ5메타데이터 통합이 특허 텍스트 생성의 신뢰성과 재현 가능성에 어떻게 기여하는가?

주요 결과

  • 모델은 메타데이터를 제어 신호로 사용하여 모든 구조적 구성 요소(종속 청구항 포함)에서 일관성 있는 특허 텍스트를 성공적으로 생성한다.
  • 이중 방향 훈련은 순방향 및 역방향 생성을 가능하게 하여 특허 초안의 반복적 개선을 지원한다.
  • ROUGE 및 Google Universal Sentence Encoder 점수는 기준 자동회귀 모델 대비 향상된 생성 품질을 확인한다.
  • 공개된 GPT-2 모델과 추론 코드를 통해 연구자 및 실무자가 프레임워크를 재현하고 확장할 수 있다.
  • 구조적 메타데이터 통합은 특허 텍스트 생성의 제어 가능성과 일관성에 크게 기여한다.
  • 모델은 실제 특허의 구조와 언어 패턴과 일치하는 텍스트 생성에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.