[論文レビュー] Patent sentiment analysis to highlight patent paragraphs
本稿では、感情タイプ(例:技術的問題、利点、ボイラープレート)をラベル付けした15万件の特許段落を含む、新規なマルチクラスデータセットを提案する。このデータセットを用いて特許段落の自動強調を実現する。探索的データ分析およびLSVCなどのベースライン機械学習モデルを用い、主要なクラスで最大97%のF1スコアを達成した。コードおよびデータをオープンソース化することで、特許情報検索分野における将来のディープラーニングおよびドメイン特化NLPの進展を促進する。
Given a patent document, identifying distinct semantic annotations is an interesting research aspect. Text annotation helps the patent practitioners such as examiners and patent attorneys to quickly identify the key arguments of any invention, successively providing a timely marking of a patent text. In the process of manual patent analysis, to attain better readability, recognising the semantic information by marking paragraphs is in practice. This semantic annotation process is laborious and time-consuming. To alleviate such a problem, we proposed a novel dataset to train Machine Learning algorithms to automate the highlighting process. The contributions of this work are: i) we developed a multi-class, novel dataset of size 150k samples by traversing USPTO patents over a decade, ii) articulated statistics and distributions of data using imperative exploratory data analysis, iii) baseline Machine Learning models are developed to utilize the dataset to address patent paragraph highlighting task, iv) dataset and codes relating to this task are open-sourced through a dedicated GIT web page: https://github.com/Renuk9390/Patent_Sentiment_Analysis and v) future path to extend this work using Deep Learning and domain specific pre-trained language models to develop a tool to highlight is provided. This work assist patent practitioners in highlighting semantic information automatically and aid to create a sustainable and efficient patent analysis using the aptitude of Machine Learning.
研究の動機と目的
- 特許書のキーテクニカル段落を審査官や弁護士が手作業で強調するという、時間のかかるプロセスを自動化すること。
- 「技術的問題」「利点」「ボイラープレート」などの意味的ラベルを付与した、特許テキストセグメントの大型スケールでマルチクラスのデータセットを構築すること。
- 意味的に重要な特許コンテンツを特定・強調できる、特許感情分析のためのベースライン機械学習モデルを確立すること。
- データセット、データ収集パイプライン、モデルコードをオープンソースで提供し、特許情報検索およびNLP分野における研究を加速すること。
- 将来のディープラーニングおよびドメイン特化事前学習言語モデルの統合を基盤として構築し、強調の正確性を向上させること。
提案手法
- 10年間にわたるUSPTOフルテキスト特許明細書をXMLパースして走査し、15万件の特許段落サンプルからなるマルチクラスデータセットを構築した。
- ラベル分布、シーケンス長、n-gram頻度(ユニグラムおよびバイグラム)を特徴づけるために、広範な探索的データ分析を実施した。
- 5つのベースライン機械学習モデル(ナイーブベイズ(NBSVM)、ロジスティック回帰(LR)、線形SVM(LSVC)、多項式ナイーブベイズ(MNB)、ランダムフォレスト(RF))を訓練および評価した。
- モデル性能を評価するために5分割交差検証を適用し、分類意思決定における単語レベルの寄与度を可視化するためにLIME解釈性ツールを用いた。
- LIMEを統合して、各ラベル(例:ニュートラル、ネガティブ、ポジティブ)に対する予測に最も寄与する単語を強調表示することで、モデルの解釈性を向上させた。
- コミュニティによる再利用および拡張を可能にするために、データセットおよびコードベースを公開GitHubリポジトリ(https://github.com/Renuk9390/Patent_Sentiment_Analysis)でリリースした。
実験結果
リサーチクエスチョン
- RQ1USPTO特許明細書から、特許段落の大型スケールでマルチクラスのデータセットを体系的に構築できるか?
- RQ2標準的な機械学習モデルは、技術的問題、利点、ボイラープレートといった意味的カテゴリに特許段落を分類する際に、どの程度の性能を示すか?
- RQ3特許テキストに見られる支配的で言語的パターンおよびラベル分布は、モデル設計およびデータ収集にどのように影響を与えるか?
- RQ4LIMEのような解釈性ツールは、特許感情分類におけるモデル意思決定を研究者および実務家が理解するのにどの程度有効か?
- RQ5データセットおよびコードをオープンソース化することで、特許情報検索および知的財産分析のためのディープラーニング分野における将来の研究をどの程度加速できるか?
主な発見
- LSVCモデルは全クラスで96%のF1スコアを達成し、クラス0では96%、クラス1では95%、クラス2では97%の個別F1スコアを記録した。
- NBSVMモデルはクラス2(「利点」カテゴリー)で97%の高いF1スコアを達成し、優れた性能を示した。
- データセットには15万件のラベル付きサンプルが含まれており、3つの主要な意味的クラスにバランスの取れた表現がなされており、強力なモデル学習を可能にしている。
- 探索的分析の結果、ユニグラムおよびバイグラムのそれぞれについて、訓練セットとテストセットの平均シーケンス長は約307トークンおよび599トークンであった。
- LSVCの混同行列は、クラス間の高い分離性を示しており、誤分類が低く、信頼性の高いモデル予測であることが確認された。
- LIMEの可視化結果から、「improves」「provides」「problem」などの語が、クラス固有のラベルに対して強い予測要因であることが確認され、モデルの解釈性が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。