Skip to main content
QUICK REVIEW

[논문 리뷰] Prior Art Search and Reranking for Generated Patent Text

Jieh-Sheng Lee, Jieh Hsiang|arXiv (Cornell University)|2020. 09. 19.
Topic Modeling참고 문헌 16인용 수 4
한 줄 요약

이 논문은 GPT-2의 훈련 데이터에서 생성된 특허 텍스트 스퍼트에 가장 유사한 기존 기술을 식별하기 위해 이단계 재정렬 접근법을 제안한다. BM25 검색과 BERT 임베딩 유사도를 조합하여, 임베딩만을 사용할 때보다 재정렬이 검색 효율성을 향상시킨다는 것을 입증한다. 다만, 장문에 대한 의미적 매칭은 여전히 도전 과제이다.

ABSTRACT

Generative models, such as GPT-2, have demonstrated impressive results recently. A fundamental question we'd like to address is: where did the generated text come from? This work is our initial effort toward answering the question by using prior art search. The purpose of the prior art search is to find the most similar prior text in the training data of GPT-2. We take a reranking approach and apply it to the patent domain. Specifically, we pre-train GPT-2 models from scratch by using the patent data from the USPTO. The input for the prior art search is the patent text generated by the GPT-2 model. We also pre-trained BERT models from scratch for converting patent text to embeddings. The steps of reranking are: (1) search the most similar text in the training data of GPT-2 by taking a bag-of-word ranking approach (BM25), (2) convert the search results in text format to BERT embeddings, and (3) provide the final result by ranking the BERT embeddings based on their similarities with the patent text generated by GPT-2. The experiments in this work show that such reranking is better than ranking with embeddings alone. However, our mixed results also indicate that calculating the semantic similarities among long text spans is still challenging. To our knowledge, this work is the first to implement a reranking system to identify retrospectively the most similar inputs to a GPT model based on its output.

연구 동기 및 목표

  • 생성된 특허 텍스트에 대해 GPT-2의 훈련 데이터에서 가장 가까운 기존 기술을 식별하는 데 도전 과제를 해결하기 위해.
  • 기존 기술의 유사성 인스턴스를 후행적으로 찾음으로써 GPT-2가 생성한 특허 청구항의 신규성 평가를 위해.
  • 어휘적 유사도와 의미적 유사도를 결합한 하이브리드 재정렬 전략을 통해 특허 분야의 기존 기술 검색을 향상시키기 위해.
  • 생성형 특허 모델에서 기억현상과 신규성 평가를 위한 실용적 프레임워크를 제공하기 위해.
  • AI가 생성한 발명의 향후 논문 평가를 위한 기초를 마련하기 위해.

제안 방법

  • 도메인 특화 텍스트 생성 및 임베딩을 가능하게 하기 위해 USPTO 특허 데이터에서부터 GPT-2 및 BERT 모델을 새로 훈련시킴.
  • 생성된 특허 스퍼트와의 어휘적 중복을 기반으로 후보 기존 기술 텍스트를 찾기 위해 BM25를 초기 검색 방법으로 사용함.
  • 상위 BM25 결과를 BERT 임베딩으로 변환하여 생성된 텍스트와의 의미적 유사도를 캡처함.
  • 후보 텍스트의 BERT 임베딩과 생성된 특허 스퍼트 간의 코사인 유사도를 사용하여 BM25 결과를 재정렬함.
  • 효율적인 BM25 검색을 위해 Elasticsearch를 활용하고, BERT 임베딩에 대한 근사 최근접 이웃 검색을 위해 Annoy를 사용함.
  • 승인된 특허에서 스퍼트 기반 비교에 국한하며, 향후 작업에서 문단 수준의 집계가 필요함.

실험 결과

연구 질문

  • RQ1BM25와 BERT 임베딩을 조합한 하이브리드 재정렬 접근법이 GPT-2가 생성한 특허 텍스트의 기존 기술 검색을 향상시킬 수 있는가?
  • RQ2임베딩만을 사용할 때보다 재정렬이 의미적으로 유사한 기존 기술을 식별하는 데 얼마나 효과적인가?
  • RQ3모델이 훈련 데이터를 얼마나 기억하는가? 그리고 기존 기술 검색은 이러한 기억현상을 특허 텍스트에서 탐지할 수 있는가?
  • RQ4특허 도메인의 새로운 입력 형식에 대해 GPT-2 모델에서 소수의 예제 학습을 달성할 수 있는가?
  • RQ5특허 도메인에서 장문의 텍스트 스퍼트에 대한 의미적 유사도 계산의 한계는 무엇인가?

주요 결과

  • BM25를 먼저 적용한 후 BERT 임베딩 유사도를 사용한 재정렬은 임베딩만을 사용할 때보다 성능이 뛰어나며, 의미적 검색에서의 오류 긍정 결과를 줄임.
  • 임베딩만을 사용할 경우 의미적으로 관련이 없는 특허 제목 간에도 높은 유사도가 나타나는 등 성능이 열악함.
  • 시스템은 생성된 특허 스퍼트에 대해 관련 기존 기술을 성공적으로 식별하여, 신규성 평가 도구로서의 가능성 입증.
  • 실험 결과, 더 긴 텍스트 스퍼트에 대한 의미적 유사도 계산은 여전히 도전 과제이며, 테스트 케이스 간 결과가 혼합됨.
  • 소수의 예제 학습은 제로샷 프롬프트에서 정확한 제목을 생성하지 못했지만, 두 번째 레코드에서 제목을 자주 생성함으로써 부분적인 패턴 학습이 이루어졌음을 시사함.
  • BM25와 임베딩 순위 간의 괴리가 문장 임베딩 훈련에서 음성 예제 생성에 특히 유용한 데이터 증강 소스가 될 수 있음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.