[論文レビュー] Prior Art Search and Reranking for Generated Patent Text
本論文は、生成された特許テキストスパンのGPT-2の学習データ内における最も類似した先行技術を特定する二段階の再ランク付けアプローチを提案する。BM25検索とBERT埋め込み類似度を組み合わせ、埋め込みのみを用いた場合に比べて再ランク付けが検索効果を向上させることを示しているが、長文における意味的マッチングは依然として困難である。
Generative models, such as GPT-2, have demonstrated impressive results recently. A fundamental question we'd like to address is: where did the generated text come from? This work is our initial effort toward answering the question by using prior art search. The purpose of the prior art search is to find the most similar prior text in the training data of GPT-2. We take a reranking approach and apply it to the patent domain. Specifically, we pre-train GPT-2 models from scratch by using the patent data from the USPTO. The input for the prior art search is the patent text generated by the GPT-2 model. We also pre-trained BERT models from scratch for converting patent text to embeddings. The steps of reranking are: (1) search the most similar text in the training data of GPT-2 by taking a bag-of-word ranking approach (BM25), (2) convert the search results in text format to BERT embeddings, and (3) provide the final result by ranking the BERT embeddings based on their similarities with the patent text generated by GPT-2. The experiments in this work show that such reranking is better than ranking with embeddings alone. However, our mixed results also indicate that calculating the semantic similarities among long text spans is still challenging. To our knowledge, this work is the first to implement a reranking system to identify retrospectively the most similar inputs to a GPT model based on its output.
研究の動機と目的
- 生成された特許テキストに対して、GPT-2の学習データ内にある最も近い先行技術を特定する課題に対処すること。
- 生成されたGPT-2特許条項の新規性を、過去に類似する学習インスタンスを特定することで後向きに評価すること。
- 語彙的および意味的類似度を組み合わせたハイブリッド再ランク付け戦略を用いて、特許分野における先行技術検索を改善すること。
- 生成的特許モデルにおける記憶化と新規性を評価する実用的なフレームワークを提供すること。
- AIが生成した発明における新規性および非自明性の未来の評価の基盤を築くこと。
提案手法
- 特許分野に特化したテキスト生成と埋め込みを可能にするために、USPTO特許データからGPT-2およびBERTモデルをスクラッチから微調整すること。
- 生成された特許スパンとの語彙的重複に基づいて、候補となる先行技術テキストを検索する初期検索手法としてBM25を用いること。
- 上位のBM25結果をBERT埋め込みに変換し、生成されたテキストとの意味的類似度を捉えること。
- 候補テキストのBERT埋め込みと生成された特許スパンの間のコサイン類似度を用いて、BM25の結果を再ランク付けすること。
- BM25検索の効率的実行のためElasticsearchを、BERT埋め込みの近似最近傍探索のためAnnoyを用いること。
- 承認済み特許におけるスパンベースの比較に限定し、将来的には段落レベルの集約が必要である。
実験結果
リサーチクエスチョン
- RQ1BM25とBERT埋め込みを組み合わせたハイブリッド再ランク付けアプローチは、GPT-2が生成した特許テキストの先行技術検索を改善できるか?
- RQ2埋め込みのみを用いた場合に比べて、再ランク付けは意味的に類似した先行技術を特定する上でどれほど効果的か?
- RQ3モデルはどの程度学習データを記憶しているのか、そして先行技術検索はそのような記憶化を特許テキストで検出できるか?
- RQ4特許分野における新しい入力フォーマットに対して、GPT-2モデルで少数の例から学習(few-shot learning)が可能か?
- RQ5特許分野における長文スパンにおける意味的類似度計算の限界は何か?
主な発見
- BM25による最初の検索に続くBERT埋め込み類似度による再ランク付けは、埋め込みのみを用いた場合よりも優れた性能を示し、意味的検索における誤検出を低減した。
- 埋め込みのみを用いた場合、意味的に無関係な特許タイトル同士に高い類似度が得られるなど、不適切な類似度が多数生じ、性能が低いことが示された。
- 本システムは、生成された特許スパンの関連する先行技術を効果的に特定でき、新規性評価ツールとしての実現可能性を示した。
- 実験から、長文スパンにおける意味的類似度計算が依然として困難であることが判明し、テストケース間で結果がまちまちであった。
- 少数の例から学習(few-shot learning)はゼロショットプロンプトで正しいタイトルを生成できなかったが、2番目の記録からタイトルを頻繁に生成しており、部分的なパターン学習が行われていた。
- BM25と埋め込みのランク付けの差異は、特に文書埋め込み学習におけるネガティブ例の生成に役立つデータ拡張の出発点となり得る。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。