Skip to main content
QUICK REVIEW

[논문 리뷰] Improving reference mining in patents with BERT

Ken S. Voskuil, Suzan Verberne|arXiv (Cornell University)|2021. 01. 04.
Intellectual Property and Patents참고 문헌 2인용 수 7
한 줄 요약

이 논문은 개선된 데이터셋에서 BERT 기반 모델(BERT, BioBERT, SciBERT)을 활용하여 특허 인용 정보 추출을 향상시켰으며, 교차 검증에서 97%의 재현율을 달성하고 이전 방법보다 50% 더 많은 인용문(총 735,000건)을 추출하였다. 이 방법은 전이 학습을 통한 시퀀스 레이블링과 함께 향상된 학습 데이터를 조합하여, 대규모 특허 코퍼스에서 내재적 및 외재적 평가 모두에서 CRF와 Flair를 크게 능가하였다.

ABSTRACT

In this paper we address the challenge of extracting scientific references from patents. We approach the problem as a sequence labelling task and investigate the merits of BERT models to the extraction of these long sequences. References in patents to scientific literature are relevant to study the connection between science and industry. Most prior work only uses the front-page citations for this analysis, which are provided in the metadata of patent archives. In this paper we build on prior work using Conditional Random Fields (CRF) and Flair for reference extraction. We improve the quality of the training data and train three BERT-based models on the labelled data (BERT, bioBERT, sciBERT). We find that the improved training data leads to a large improvement in the quality of the trained models. In addition, the BERT models beat CRF and Flair, with recall scores around 97% obtained with cross validation. With the best model we label a large collection of 33 thousand patents, extract the citations, and match them to publications in the Web of Science database. We extract 50% more references than with the old training data and methods: 735 thousand references in total. With these patent-publication links, follow-up research will further analyze which types of scientific work lead to inventions.

연구 동기 및 목표

  • 특허의 본문 내 인용 정보 추출의 정확성과 재현율을 향상시키기 위해, 일반적으로 앞면 인용보다 간과되기 쉬운 본문 내 인용 정보를 대상으로 한다.
  • 이전 데이터셋의 한계를 해결하기 위해 반복적인 모델 분석을 통해 레이블링 및 전처리 오류를 식별하고 수정한다.
  • 특허 인용 정보 추출을 위한 시퀀스 레이블링에서 CRF와 Flair 대비 BERT 기반 모델(BERT, BioBERT, SciBERT)의 성능을 평가한다.
  • 최고 성능을 보인 모델을 사용하여 33,338건의 레이블이 없는 생물기술 특허 코퍼스에 대해 대규모로 특허-출판물 링크를 추출한다.
  • BERT 및 CRF 모델의 오류 패턴을 분석하여, 이들이 후속 참조 파싱 및 매칭에 미치는 영향을 이해한다.

제안 방법

  • 이전의 22건의 특허 데이터셋에서 레이블링 오류를 재평가하고 수정하기 위해 모델 예측 결과와 수동 검토를 활용하여, 더 높은 품질의 학습 데이터셋을 확보한다.
  • 본문 텍스트 내 참조 범위를 식별하기 위해 IOB 태깅을 사용하여 BERT, BioBERT, SciBERT의 세 가지 BERT 기반 모델을 시퀀스 레이블링을 위해 미세조정한다.
  • 개선된 데이터셋을 기반으로 이탈리안 교차 검증을 수행하며, 정밀도, 재현율, F1 점수를 보고한다.
  • 가장 높은 성능를 보인 모델(SciBERT)을 사용하여 33,338건의 미국 특허청 생물기술 특허로 구성된 대규모 레이블이 없는 코퍼스에서 본문 내 인용 정보를 추출한다.
  • 추출된 인용 정보를 웹 오브 사이언스 데이터베이스와 매칭하여 외재적 성능를 평가하며, 정밀도보다 재현율을 우선시한다.
  • 오류 분석은 참조 범위 내에서 'O' 예측의 상대적 위치를 분석하여, BERT와 CRF 모델 간의 오류 패턴의 구조적 차이를 이해하기 위해 수행된다.

실험 결과

연구 질문

  • RQ1BERT 기반 모델은 CRF와 Flair에 비해 특허의 본문 내 인용 정보 추출에서 재현율을 크게 향상시킬 수 있는가?
  • RQ2학습 데이터의 품질 향상이 인용 정보 추출 성능에 어떤 영향을 미치는가?
  • RQ3BERT 기반 모델과 CRF 간의 시퀀스 레이블링 오류 패턴은 어떻게 다른가?
  • RQ4대규모 레이블이 없는 특허 코퍼스에 적용했을 때 BERT 모델은 이전 방법보다 얼마나 뛰어난가?
  • RQ5개선된 모델은 이전 방법보다 더 많은 특허-출판물 링크를 추출할 수 있으며, 이는 과학-산업 지식 유동성 분석을 향상시키는가?

주요 결과

  • 향상된 학습 데이터 덕분에 성능 향상이 크게 이루어졌으며, BERT 기반 모델은 교차 검증에서 97%의 재현율을 달성하여 CRF와 Flair를 크게 능가하였다.
  • 가장 우수한 모델(SciBERT)은 33,338건의 레이블이 없는 특허에서 735,000건의 본문 내 인용 정보를 추출하였으며, 이는 이전 방법 대비 50% 더 많은 수치였다.
  • BERT 모델은 CRF에 비해 오류 시퀀스가 적고 짧았으며(중위수 길이 1~2), 오류가 참조 내에서 균일하게 분포되어 있었다.
  • CRF 모델은 장기간 시퀀스를 처리하는 데서 기인한 구조적 한계로 인해 특히 중간 부분의 전체 참조 세그먼트를 놓치기 쉬웠다.
  • 내재적 점수는 유사했지만, BERT 모델은 더 높은 재현율과 더 나은 외재적 평가 성능를 보였으며, 이는 실제 데이터에 대한 일반화 능력이 뛰어남을 시사한다.
  • 오류 분석 결과, CRF 모델은 참조의 시작이나 끝에서 실패하는 경향이 있었고, BERT 모델은 내부 토큰을 더 자주 놓치는 경향이 있었으며, 이는 서로 다른 실패 방식을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.