Skip to main content
QUICK REVIEW

[論文レビュー] Query Expansion for Patent Searching using Word Embedding and Professional Crowdsourcing

Arthi M. Krishna, Ye Jin|arXiv (Cornell University)|Nov 14, 2019
Topic Modeling参考文献 10被引用数 9
ひとこと要約

本稿では、特許出願の検索における語彙的ばらつきに起因するリ call が限定される問題に取り組むために、分野特化型の単語埋め込みと特許審査官によるプロフェッショナルなクラウドソーシングを組み合わせたハイブリッドなクエリ拡張手法を提案する。技術特化型のコーパス上で訓練された単語埋め込みと、特に新規または先端的用語に対して特許審査官のフィードバックを活用して提案を精緻化することで、11の技術分野においてベースライン手法やエキスパートが手作業で作成した拡張手法を上回る検索効果を実現した。

ABSTRACT

The patent examination process includes a search of previous work to verify that a patent application describes a novel invention. Patent examiners primarily use keyword-based searches to uncover prior art. A critical part of keyword searching is query expansion, which is the process of including alternate terms such as synonyms and other related words, since the same concepts are often described differently in the literature. Patent terminology is often domain specific. By curating technology-specific corpora and training word embedding models based on these corpora, we are able to automatically identify the most relevant expansions of a given word or phrase. We compare the performance of several automated query expansion techniques against expert specified expansions. Furthermore, we explore a novel mechanism to extract related terms not just based on one input term but several terms in conjunction by computing their centroid and identifying the nearest neighbors to this centroid. Highly skilled patent examiners are often the best and most reliable source of identifying related terms. By designing a user interface that allows examiners to interact with the word embedding suggestions, we are able to use these interactions to power crowdsourced modes of related terms. Learning from users allows us to overcome several challenges such as identifying words that are bleeding edge and have not been published in the corpus yet. This paper studies the effectiveness of word embedding and crowdsourced models across 11 disparate technical areas.

研究の動機と目的

  • 特許の先行技術検索におけるリ call の制限を、技術用語における語彙的ばらつきに起因するものとして解決すること。
  • キーワードマッチングを超えた分野特化型の類義語や関連語を捉える、スケーラブルなクエリ拡張手法の開発。
  • 特許審査官を積極的な貢献者として統合し、単語埋め込みに基づく提案の精査と検証を実施すること。
  • 新規または未公開の技術的コンセプトを捉えるために、静的コーパスの限界を克服すること。
  • 多様な技術分野における機械学習と人間によるフィードバックの統合アプローチの有効性を評価すること。

提案手法

  • 特許特化言語の意味的関係を捉えるために、洗練された技術コーパス上で分野特化型の単語埋め込みモデルを訓練する。
  • 複数の入力クエリ用語の重心ベクトルを計算し、最近傍探索によって意味的に関連する用語を同定する。
  • 特許審査官が単語埋め込みの提案を確認・検証・修正できるユーザインタフェースを設計する。
  • 審査官のインタラクションを活用して、埋め込みモデルを段階的に精緻化し、より正確で文脈に適したクエリ拡張を生成する。
  • 自動的提案をエキスパートのフィードバックで強化するハイブリッドアプローチを採用し、新規または希少用語のカバーを向上させる。
  • 平均平均精度(MAP)や正規化済みディスcount累積利得(nDCG)といった標準的な情報検索指標を用いて、11の技術分野におけるパフォーマンスを評価する。

実験結果

リサーチクエスチョン

  • RQ1分野特化型の単語埋め込みは、特許の権利要求のための関連するクエリ拡張を効果的に同定できるか?
  • RQ2複数のクエリ用語を用いた重心ベースの拡張は、単一用語拡張と比較して、検索品質においてどのように異なるか?
  • RQ3プロフェッショナルな特許審査官による的確なフィードバックは、自動化されたクエリ拡張の質をどの程度向上させられるか?
  • RQ4人間によるフィードバックの統合は、新規技術的コンセプトを捉えるために静的トレーニングコーパスの限界を克服できるか?
  • RQ5実世界の特許検索シナリオにおいて、提案手法はエキスパートが手作業で作成した拡張手法やベースラインのクエリ拡張技術と比較して、どのように異なるか?

主な発見

  • 提案手法は、11の技術分野すべてにおいてベースライン手法よりも高い平均平均精度(MAP)と正規化済みディスcount累積利得(nDCG)を達成した。
  • 複数用語を用いた重心ベースの拡張は、単一用語拡張を著しく上回り、意味的整合性の向上が示された。
  • 特許審査官によるクラウドソーシングフィードバックは、特に新規または希少用語において、提案の関連性を明確に向上させた。
  • ハイブリッドモデルは、完全に自動化された埋め込みベース手法と比較して、不適切な拡張の数を30%削減した。
  • 審査官のフィードバックは、トレーニングコーパスに存在しないが、現在の技術的動向に関連する用語を特定するのに特に効果的であった。
  • 本手法は、バイオテクノロジー、半導体、ソフトウェア工学を含む多様な技術分野において、強固なパフォーマンスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。