Skip to main content
QUICK REVIEW

[論文レビュー] Text-based Technological Signatures and Similarities: How to create them and what to do with them.

Daniel S. Hain, Roman Jurowetzki|arXiv (Cornell University)|Mar 27, 2020
Computational Drug Discovery Methods参考文献 92被引用数 4
ひとこと要約

本稿では、NLP埋め込みを用いてテキストベースの特許技術的シグネチャを生成する手法を紹介し、近似的最近傍手法を用いて特許全体の宇宙にわたる技術的類似性を効率的に計算可能にする。このアプローチにより大規模な技術的ネットワーク分析が可能となり、知識の流れ、特許の質、技術的変化の測定に実証応用が可能である。

ABSTRACT

This paper describes a new approach to measure technological similarity between patents by leveraging their textual description. Using embedding techniques from natural language processing, we represent their description as a high dimensional numerical vector, thus capturing their technological signature. Deploying an almost near linear-scaling approximate nearest neighbor matching techniques, we are able to compute technological similarity scores for all existing patents. This enables us to represent the whole patent universe as a technological network. We validate both technological signature and similarity in various ways, and demonstrate their usefulness to create patent quality indicators, measure knowledge flows, and map technological change.

研究の動機と目的

  • 特許のテキスト的記述を用いて、スケーラブルな技術的類似性測定手法を開発すること。
  • NLP埋め込み技術を用いて特許テキストからコンパクトで高次元の技術的シグネチャを生成すること。
  • 近線形スケーリングアルゴリズムを用いて、特許全体の宇宙にわたる類似性計算を効率的に行えるようにすること。
  • 技術的シグネチャおよび類似性スコアの信頼性と実用的有用性を検証すること。
  • 特許の質の評価、知識の流れの追跡、技術的進化のマッピングへの応用を示すこと。

提案手法

  • 事前学習済みのNLP埋め込みを用いて、各特許のテキスト的記述を高次元の数値ベクトルに表現する。
  • 大規模なスケールでペアワイズ技術的類似性スコアを効率的に計算するために、近的最近傍(ANN)アルゴリズムを適用する。
  • 特許をノード、類似性スコアをエッジとしてモデル化することで技術的ネットワークを構築する。
  • 一貫性のチェックと既知の技術的関係とのベンチマーク比較を通じて、技術的シグネチャを検証する。
  • 得られた類似性スコアを活用して、特許の質、知識拡散、技術的変化の指標を導出する。
  • 埋め込み空間を活用して、技術的発展における意味的・構造的パターンを分析する。

実験結果

リサーチクエスチョン

  • RQ1NLP技術を用いて、どのように特許テキストを安定的かつ情報豊富な技術的シグネチャに変換できるか?
  • RQ2近的最近傍手法は、特許全体の宇宙にわたるスケーラブルな類似性計算をどの程度可能にするか?
  • RQ3生成された技術的シグネチャおよび類似性スコアは、現実世界の技術的関係をどの程度信頼性高く捉えられるか?
  • RQ4これらのシグネチャを用いて構築された技術的ネットワークから、どのような実用的応用が生じるか?
  • RQ5この手法は、時間経過に伴う知識の流れを効果的に測定し、技術的変化を追跡できるか?

主な発見

  • 本手法は、NLP埋め込みを用いて、特許テキストから安定的かつ情報豊富な技術的シグネチャを効果的に生成した。
  • 近的最近傍手法を用いることで、近線形時間計算量を達成し、特許全体の宇宙にわたるスケーラブルな類似性計算が可能になった。
  • 得られた技術的ネットワークは、一貫性およびベンチマーク比較を通じて検証された意味のある特許間関係を捉えている。
  • 本手法により、技術的近接性とイノベーションの文脈に基づいた、新たな特許の質の指標の創出が可能になった。
  • フレームワークは、産業および時間的経過にわたる知識の流れのマッピングと技術的変化のパターンの追跡を効果的に実行した。
  • 本研究は、テキストベースの技術的シグネチャが、大規模なイノベーション分析の強固な基盤を提供することを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。