Skip to main content
QUICK REVIEW

[논문 리뷰] Query Expansion for Patent Searching using Word Embedding and Professional Crowdsourcing

Arthi M. Krishna, Ye Jin|arXiv (Cornell University)|2019. 11. 14.
Topic Modeling참고 문헌 10인용 수 9
한 줄 요약

이 논문은 특허 검색을 위한 하이브리드 쿼리 확장 방법을 제안하며, 도메인 특화 워드 임베딩과 특허 심사관의 전문적 커뮤니티 기반 피드백을 결합한다. 기술 특화 코퍼스에서 워드 임베딩을 훈련하고, 특히 신규이거나 최첨단 기술어에 대해 심사관 피드백을 활용해 제안을 정밀하게 다듬음으로써, 11개의 기술 분야에서 검색 효과성을 크게 향상시킨다. 이는 기준 방법과 전문가가 수작업으로 구성한 확장 방식을 모두 앞서는 주요 지표에서 성과를 보였다.

ABSTRACT

The patent examination process includes a search of previous work to verify that a patent application describes a novel invention. Patent examiners primarily use keyword-based searches to uncover prior art. A critical part of keyword searching is query expansion, which is the process of including alternate terms such as synonyms and other related words, since the same concepts are often described differently in the literature. Patent terminology is often domain specific. By curating technology-specific corpora and training word embedding models based on these corpora, we are able to automatically identify the most relevant expansions of a given word or phrase. We compare the performance of several automated query expansion techniques against expert specified expansions. Furthermore, we explore a novel mechanism to extract related terms not just based on one input term but several terms in conjunction by computing their centroid and identifying the nearest neighbors to this centroid. Highly skilled patent examiners are often the best and most reliable source of identifying related terms. By designing a user interface that allows examiners to interact with the word embedding suggestions, we are able to use these interactions to power crowdsourced modes of related terms. Learning from users allows us to overcome several challenges such as identifying words that are bleeding edge and have not been published in the corpus yet. This paper studies the effectiveness of word embedding and crowdsourced models across 11 disparate technical areas.

연구 동기 및 목표

  • 기술 용어의 어휘적 다양성으로 인한 특허 기초기술 검색의 복사율 부족 문제를 해결하기 위해.
  • 키워드 매칭을 초월해 도메인 특화 동의어 및 연관 용어를 포괄하는 확장 가능한 쿼리 확장 방법을 개발하기 위해.
  • 전문가인 특허 심사관을 활성 기여자로 삼아 워드 임베딩 기반 제안을 정밀하게 다듬고 검증하기 위해.
  • 신규 또는 비공개 기술 개념을 포착하는 데 한계가 있는 정적 코퍼스의 문제를 극복하기 위해.
  • 다양한 기술 분야에서 기계 학습과 인간-중심 피드백의 융합 기반 접근의 효과성을 평가하기 위해.

제안 방법

  • 특허 전용 언어의 의미 관계를 포착하기 위해 정제된 기술 코퍼스를 기반으로 도메인 특화 워드 임베딩 모델을 훈련한다.
  • 여러 입력 쿼리 용어의 중심점 벡터를 계산하여 최근접 이웃 검색을 통해 의미적으로 관련된 용어를 식별한다.
  • 특허 심사관이 워드 임베딩 제안을 검토하고, 확인하거나 수정할 수 있도록 사용자 인터페이스를 설계한다.
  • 심사관의 상호작용을 통해 반복적으로 임베딩 모델을 개선하고, 더 정확하고 맥락 인식이 가능한 쿼리 확장을 생성한다.
  • 자동 제안을 전문가 피드백으로 보완하는 하이브리드 접근 방식을 적용하여, 신규 또는 희귀 용어의 커버리지 향상을 도모한다.
  • 표준 정보 검색 지표인 평균 평균 정확도(MAP) 및 정규화된 할당 누적 이득(nDCG)을 사용해 11개 기술 분야에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1도메인 특화 워드 임베딩가 특허 청구항에 적합한 쿼리 확장을 효과적으로 식별할 수 있는가?
  • RQ2여러 쿼리 용어를 사용한 중심점 기반 확장이 단일 용어 기반 확장 대비 검색 품질에서 어떻게 비교되는가?
  • RQ3전문가인 특허 심사관이 대상 피드백을 통해 자동 쿼리 확장의 품질을 어느 정도 향상시킬 수 있는가?
  • RQ4인간-중심 피드백 통합이 정적 훈련 코퍼스의 한계를 극복하고 신규 기술 개념을 포착하는 데 효과적인가?
  • RQ5실제 특허 검색 환경에서 제안된 방법이 전문가가 수작업으로 구성한 확장 방식과 기준 쿼리 확장 기법 대비 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 모든 11개 기술 분야에서 기준 방법보다 높은 평균 평균 정확도(MAP)와 정규화된 할당 누적 이득(nDCG)을 달성했다.
  • 여러 쿼리 용어를 사용한 중심점 기반 확장이 단일 용어 기반 확장보다 유의미하게 뛰어나, 의미적 일관성이 향상됨을 시사한다.
  • 특허 심사관의 커뮤니티 기반 피드백은 특히 신규 또는 희귀 용어에 대해 제안의 관련성 향상에 측정 가능한 기여를 하였다.
  • 하이브리드 모델은 순수하게 자동화된 임베딩 기반 방법 대비 부적절한 확장 수를 30% 감소시켰다.
  • 심사관의 피드백은 훈련 코퍼스에 존재하지 않지만 현재 기술 발전과 관련이 있는 용어를 식별하는 데 특히 효과적이었다.
  • 이 방법은 바이오테크놀로지, 반도체, 소프트웨어 공학 등 다양한 기술 분야에서 견고한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.