[論文レビュー] Deep Patent Landscaping Model Using Transformer and Graph Embedding
本稿では、テキスト解析に変更を加えたTransformerと、書誌的メタデータ用のDiff2Vecグラフ埋め込みを組み合わせた深層学習モデルを提案する。このモデルは、新たに導入された4つのベンチマークデータセットにおいて最先端の性能を達成し、既存手法と比較して平均分類精度を約15%向上させる。
Patent landscaping is a method used for searching related patents during a research and development (R&D) project. To avoid the risk of patent infringement and to follow current trends in technology, patent landscaping is a crucial task required during the early stages of an R&D project. As the process of patent landscaping requires advanced resources and can be tedious, the demand for automated patent landscaping has been gradually increasing. However, a shortage of well-defined benchmark datasets and comparable models makes it difficult to find related research studies. In this paper, we propose an automated patent landscaping model based on deep learning. To analyze the text of patents, the proposed model uses a modified transformer structure. To analyze the metadata of patents, we propose a graph embedding method that uses a diffusion graph called Diff2Vec. Furthermore, we introduce four benchmark datasets for comparing related research studies in patent landscaping. The datasets are produced by querying Google BigQuery, based on a search formula from a Korean patent attorney. The obtained results indicate that the proposed model and datasets can attain state-of-the-art performance, as compared with current patent landscaping models.
研究の動機と目的
- 研究開発プロジェクトにおける繰り返しで高コストな手作業による特許ランドスケーピングの自動化を目的とする。
- 特許ランドスケーピング研究のための公開可能で明確に定義されたベンチマークデータセットの不足に対処することを目的とする。
- テキスト的および書誌的特許特徴を効果的に統合できる統合型の深層学習モデルの開発を目的とする。
- 高度な自然言語処理およびグラフ表現技術を用いて、関連する特許を特定する分類精度の向上を目的とする。
- 新規に公開された関連特許の効率的でスケーラブルかつ正確な検索を可能にすることで、継続的な特許監視を支援することを目的とする。
提案手法
- 特許のタイトル、概要、特許請求の範囲を含むテキストをエンコード・分類するために、変更を加えたTransformerアーキテクチャが使用される。
- Diff2Vec、すなわち拡散に基づくグラフ埋め込み手法が、書誌的メタデータ(例:出願人、出願番号、IPC分類)をグラフ構造としてモデル化するために適用される。
- TransformerおよびDiff2Vecの両コンポーネントからの表現を統合し、エンドツーエンドの特許関連性分類を実現する。
- Google BigQueryと韓国知的財産戦略院(KISTA)のエキスパートがキュレートした検索式を用いて、4つのベンチマークデータセットが構築される。
- データセットは実世界の特許トレンドレポートから抽出され、シード特許とその関連参考文献を含むため、高品質な訓練および評価データを保証する。
- バイナリ関連性ラベルを用いて教師あり学習でモデルを訓練し、標準的な分類指標を用いて性能を評価する。
実験結果
リサーチクエスチョン
- RQ1Transformerベースのテキストエンコーディングとグラフ埋め込みを組み合わせた深層学習モデルは、既存手法を上回る性能を示すか。
- RQ2提案されたベンチマークデータセットは、特許ランドスケーピング研究における再現性と比較可能性をどの程度向上させるか。
- RQ3テキスト的および書誌的特徴の統合は、多様な技術分野にわたる関連特許の特定においてどの程度有効か。
- RQ4ベンチマークデータセットの多様性を考慮すると、最小限の微調整でモデルは異なる技術分野に一般化できるか。
- RQ5分類精度および頑健性の観点から、提案モデルはベースラインモデルに対してどの程度の性能向上を達成するか。
主な発見
- 提案モデルは、すべての4つのベンチマークデータセットで最先端の性能を達成し、既存の分類モデルを著しく上回る。
- すべてのデータセットにおける平均分類精度は、ベースラインモデルと比較して約15%向上する。
- グラフベースのメタデータにDiff2Vecを統合することで、キーワードマッチングを越えた特許間の複雑な関係を捉える能力が向上する。
- KISTA特許トレンドレポートからのエキスパートがキュレートした検索式の使用により、高品質でドメイン関連性の高い訓練データがベンチマークデータセットに確保される。
- ベンチマークデータセットは公開されており、自動特許ランドスケーピング分野における再現可能な研究を支援するように設計されている。
- モデルは、海洋ビークル、誘導加熱、気象監視、および人工衛星画像処理を含む多様な技術分野に強く一般化していることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。