Skip to main content
QUICK REVIEW

[논문 리뷰] PatentMatch: A Dataset for Matching Patent Claims & Prior Art.

Julian Risch, Nicolas Alder|arXiv (Cornell University)|2020. 12. 27.
Biomedical Text Mining and Ontologies참고 문헌 28인용 수 12
한 줄 요약

PatentMatch는 유럽특허권청(EPO) 검색 보고서에서 추출한 기술명세서의 권리요약과 의미적으로 매칭된 기존기술 문장을 대응시킨 대규모 전문가 주석이 부여된 데이터셋이다. 이는 특허 기술명세서의 기존기술 검색을 위한 지도학습 모델 훈련을 가능하게 하며, 초기 BERT 기반 실험 결과는 중간 정도의 성능(52–54% 정확도)을 보였고, 특허 전용 언어에서 의미 매칭을 수행하는 데의 어려움을 시사한다.

ABSTRACT

Patent examiners need to solve a complex information retrieval task when they assess the novelty and inventive step of claims made in a patent application. Given a claim, they search for prior art, which comprises all relevant publicly available information. This time-consuming task requires a deep understanding of the respective technical domain and the patent-domain-specific language. For these reasons, we address the computer-assisted search for prior art by creating a training dataset for supervised machine learning called PatentMatch. It contains pairs of claims from patent applications and semantically corresponding text passages of different degrees from cited patent documents. Each pair has been labeled by technically-skilled patent examiners from the European Patent Office. Accordingly, the label indicates the degree of semantic correspondence (matching), i.e., whether the text passage is prejudicial to the novelty of the claimed invention or not. Preliminary experiments using a baseline system show that PatentMatch can indeed be used for training a binary text pair classifier on this challenging information retrieval task. The dataset is available online: https://hpi.de/naumann/s/patentmatch.

연구 동기 및 목표

  • 특허 심사에서 기존기술 검색을 자동화하는 데 도전하는 것 — 이 작업은 깊이 있는 기술적 및 법적 도메인 지식이 요구된다.
  • 특허 관련 정보 검색 분야에서 지도학습 모델을 훈련하기 위한 고품질의 전문가 주석이 부여된 데이터셋을 제공하는 것.
  • 특허 심사관이 신규성 파기 기존기술을 고정밀도로 식별하는 데 도움이 되는 AI 시스템 개발을 지원하는 것.
  • EPO에서의 전문가 검색 행동과 검색 보고서 작성 과정을 체계적으로 분석할 수 있도록 하는 것.
  • 학습된 모델을 활용해 절반 자동화된 문장 검색 및 검색 쿼리 전략 개선에 기여하는 연구를 촉진하는 것.

제안 방법

  • 이 데이터셋은 EPO 검색 보고서에서 유래되었으며, 각 권리요약에 대해 관련 기존기술 문장을 명시적으로 주석 처리한 자료를 포함한다.
  • 각 데이터 포인트는 기술명세서의 권리요약과 인용된 기존기술 문서의 텍스트 문장으로 구성되며, EPO 심사관이 'X'(신규성 파기) 또는 'A'(배경, 신규성 없음 또는 명백함)로 레이블링한다.
  • 이 데이터셋은 실제 특허 출원 및 등록 특허에서 유래한 권리요약과 문장들을 포함하며, 훈련 및 테스트 세트는 출원 일자를 기준으로 분리되어 시간적 유효성을 확보한다.
  • 기본 모델로 BERT 기반의 텍스트 쌍 분류 모델을 사용하여, 문장이 권리요약과 'X' 또는 'A' 문서로 매칭되는지 예측하도록 미세조정한다.
  • 모델은 BERT-base-uncased 아키텍처의 [CLS] 토큰 표현을 사용하여 권리요약과 문장 간의 의미적 일치도를 분류한다.
  • 실험은 FARM 프레임워크를 사용하며, 모델의 일반화 능력과 강건성을 평가하기 위해 균형 잡힌 데이터와 단일 인용 데이터 변형을 평가한다.

실험 결과

연구 질문

  • RQ1지도학습 기반의 머신러닝 모델이 특허 권리요약의 신규성 파기 기반 기존기술 문장을 효과적으로 식별할 수 있는가?
  • RQ2BERT와 같은 사전학습된 트랜스포머 모델의 성능이 특허 전용 언어에서 의미 매칭이라는 복잡한 과제에 어떻게 일반화되는가?
  • RQ3EPO 검색 보고서에서 주어진 전문가 주석 데이터가 기존기술 검색 시스템의 정밀도를 얼마나 향상시킬 수 있는가?
  • RQ4특허 권리요약과 관련 기존기술 문장을 매칭하는 데 있어 주요 언어적 및 구조적 과제는 무엇이며, 이는 모델 성능에 어떤 영향을 미치는가?
  • RQ5학습된 모델이 특허 심사관이 사용하는 수동 키워드 쿼리를 향상하거나 적응시켜 기존기술 검색의 리콜을 높일 수 있는가?

주요 결과

  • PatentMatch 데이터셋은 EPO 검색 보고서를 통해 연결된 특허 권리요약과 기존기술 문장 간의 대규모 전문가 주석이 부여된 자료로서, 특허 기존기술 검색 모델의 훈련 및 평가에 활용 가능하다.
  • 미세조정된 BERT 모델을 사용한 초도 실험 결과, 균형 잡힌 데이터 분할에서 테스트 세트 정확도가 54%를 기록하여 이 과제가 여전히 매우 도전적임을 시사한다.
  • 정확히 하나의 'X' 문서와 하나의 'A' 문서가 각 권리요약에 대응하는 더 제한된 데이터 분할에서는 52%의 정확도를 기록하여, 최소한의 데이터 변형에서의 성능 향상이 제한적임을 나타낸다.
  • 검증 손실이 단지 6 에포크 후에 정체되며, 특허 텍스트의 복잡한 언어 패턴에서 학습하는 데의 어려움과 느린 수렴을 시사한다.
  • 랜덤 추측보다도 낮은 정확도는 심지어 최신 기술 모델이라도 특허 전용 법적 및 기술적 언어에서 의미 매칭을 수행하는 데의 어려움을 강력히 시사한다.
  • 이 데이터셋은 향후 전문가 검색 행동, 관련 참조 누락 분석, 수동 쿼리 전략과 학습된 모델의 통합에 관한 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.