Skip to main content
QUICK REVIEW

[논문 리뷰] Random Forest DBSCAN for USPTO Inventor Name Disambiguation

Kunho Kim, Madian Khabsa|arXiv (Cornell University)|2016. 02. 04.
Data Quality and Management참고 문헌 22인용 수 12
한 줄 요약

이 논문은 랜덤 포레스트 분류기와 DBSCAN을 활용하여 미국 특허상표청(USPTO) 특허 데이터베이스 내 발명가 성명의 동일인 식별 문제를 해결하기 위한 확장 가능한 기계학습 기반 접근법을 제안한다. 이는 쌍별 유사도를 계산하고 클러스터링을 수행한다. 제안된 방법은 USPTO PatentsView 경쟁 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 1200만 건의 발명가 언급을 6.5시간 내에 처리하여 모든 경쟁 알고리즘을 능가하는 F1 스코어를 기록하였다.

ABSTRACT

Name disambiguation and the subsequent name conflation are essential for the correct processing of person name queries in a digital library or other database. It distinguishes each unique person from all other records in the database. We study inventor name disambiguation for a patent database using methods and features from earlier work on author name disambiguation and propose a feature set appropriate for a patent database. A random forest was selected for the pairwise linking classifier since they outperform Naive Bayes, Logistic Regression, Support Vector Machines (SVM), Conditional Inference Tree, and Decision Trees. Blocking size, very important for scaling, was selected based on experiments that determined feature importance and accuracy. The DBSCAN algorithm is used for clustering records, using a distance function derived from random forest classifier. For additional scalability clustering was parallelized. Tests on the USPTO patent database show that our method successfully disambiguated 12 million inventor mentions within 6.5 hours. Evaluation on datasets from USPTO PatentsView inventor name disambiguation competition shows our algorithm outperforms all algorithms in the competition.

연구 동기 및 목표

  • 공통 성함, 이름 변형, 철자 오류 등으로 인해 자주 모호해지는 대규모 특허 데이터베이스 내 발명가 성명의 동일인 식별 문제를 해결하기 위해.
  • 일반적인 저자 성명 동일인 식별 특징과 비교하여 특허 메타데이터에 특화된 특징 세트를 개발하여 정확도를 향상시키기 위해.
  • 수백만 건의 발명가 레코드를 효율적으로 처리할 수 있는 확장 가능하고 병렬 처리 가능한 시스템을 설계하기 위해.
  • 하이브리드 랜덤 포레스트 및 DBSCAN 파이프라인을 사용하여 USPTO PatentsView 발명가 성명 동일인 식별 경쟁에서 기존 알고리즘을 능가하기 위해.

제안 방법

  • 특허 메타데이터에서 유도된 맞춤형 특징 세트를 기반으로 랜덤 포레스트 분류기를 훈련한다. 이 특징에는 이름 변형, 소속 기관, 출판 역사 등이 포함된다.
  • 발명가 레코드 간의 쌍별 유사도는 동일 발명가 매칭을 나타내는 랜덤 포레스트 분류기의 투표 비율로 계산된다.
  • 랜덤 포레스트에서 유도된 거리 함수를 사용하여 DBSCAN 클러스터링을 적용하여 레코드를 고유한 발명가 클러스터로 그룹화한다.
  • 계산 복잡도를 줄이기 위해 블로킹 전략을 적용하고, 블록을 여러 코어에 분산하여 병렬 처리를 가능하게 한다.
  • 메모리에 민감한 블로킹 전략을 사용하여 인기 있는 이름으로 인한 큰 블록을 관리하지만, 여전히 메모리가 성능 저하의 주요 원인이 된다.
  • 표준 평가 지표인 정밀도, 재현도, F1 스코어를 사용하여 USPTO PatentsView 경쟁 데이터셋에서 방법을 평가한다.

실험 결과

연구 질문

  • RQ1특허 전용 특징으로 훈련된 랜덤 포레스트 분류기가 SVM, 나이브 베이즈, 로지스틱 회귀와 같은 전통적 분류기보다 발명가 성명 동일인 식별에서 더 뛰어난 성능을 보일 수 있는가?
  • RQ2랜덤 포레스트 기반의 유사도 함수와 DBSCAN 클러스터링을 조합하면 다른 클러스터링 또는 분류 방법보다 더 높은 동일인 식별 정확도를 달성할 수 있는가?
  • RQ3제안된 블로킹 및 병렬 처리 전략은 1200만 건의 특허 데이터베이스에서 확장성과 런타임 성능에 어떤 영향을 미치는가?
  • RQ4기존 솔루션과 비교하여 이 방법은 USPTO PatentsView 경쟁에서 재현도와 F1 스코어를 얼마나 향상시키는가?

주요 결과

  • 제안된 방법은 모든 테스트 세트에서 평균 F1 스코어 0.9882 ± 0.0029를 기록하였으며, 경쟁 우승자의 F1 스코어 0.9827 ± 0.0035보다 유의미하게 높았다 (p = 0.03125, 단측 윌콕슨 서열 테스트).
  • 랜덤 포레스트 분류기는 최소 0.05%의 OOB 오차율을 기록하여 쌍별 분류의 높은 신뢰성을 입증하였다.
  • 12코어 머신에서 1200만 건의 발명가 언급을 6.5시간 내에 성공적으로 동일인 식별하여 병렬 처리를 통한 뛰어난 확장성을 입증하였다.
  • 공통 특성 데이터셋에서 약간 더 높은 성능을 보였는데, 이는 더 큰 표본 크기와 전체 데이터베이스 분포의 더 나은 반영 때문이었다.
  • 재현도가 정밀도보다 낮았는데, 이는 블로킹 전략이 일부 참값 매칭을 누락시켰음을 시사하며, 블로킹 전략의 개선 여지가 있음을 시사한다.
  • 랜덤 포레스트 투표로부터 유도된 학습된 거리 함수는 수작업으로 설계된 지표보다 더 효과적이었으며, 뛰어난 클러스터링 성능을 가능케 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.