Skip to main content
QUICK REVIEW

[論文レビュー] Large Language Model Prompt Chaining for Long Legal Document Classification

Dietrich Trautmann|arXiv (Cornell University)|Aug 8, 2023
Topic Modeling被引用数 7
ひとこと要約

本稿では、大規模言語モデル(LLMs)を用いたfew-shotの文脈内学習を活用し、文書要約、例示文書の意味的検索、反復的プロンプト生成を統合した、長文法的文書の分類のためのプロンプトチェーニングフレームワークを提案する。この手法は、二つの法的テキスト分類タスクにおいて、ゼロショットのGPT-3.5-turboを上回るマイクロ-F1スコアを達成しており、より小型で効率的なLLMsを用いても、大規模モデルを凌駆する性能を示している。

ABSTRACT

Prompting is used to guide or steer a language model in generating an appropriate response that is consistent with the desired outcome. Chaining is a strategy used to decompose complex tasks into smaller, manageable components. In this study, we utilize prompt chaining for extensive legal document classification tasks, which present difficulties due to their intricate domain-specific language and considerable length. Our approach begins with the creation of a concise summary of the original document, followed by a semantic search for related exemplar texts and their corresponding annotations from a training corpus. Finally, we prompt for a label - based on the task - to assign, by leveraging the in-context learning from the few-shot prompt. We demonstrate that through prompt chaining, we can not only enhance the performance over zero-shot, but also surpass the micro-F1 score achieved by larger models, such as ChatGPT zero-shot, using smaller models.

研究の動機と目的

  • 専門的な言語や構造を持つ長く複雑な法的文書を分類する課題に対処すること。
  • 高価なファインチューニングや専門家がアノテートしたデータセットへの依存を減らすために、few-shotプロンプトを活用すること。
  • モジュール型で解釈可能なプロンプトチェーニング戦略を用いて、ゼロショットプロンプトに比べて分類性能を向上させること。
  • 構造的なプロンプト生成を用いることで、GPT-3.5-turboのような大規模モデルよりも小型LLMsがゼロショット設定で優れた性能を示すかどうかを評価すること。
  • 実世界のベンチマークを用いて、法的NLPタスクにおけるプロンプトチェーニングの実現可能性と有効性を示すこと。

提案手法

  • まず、入力された法的文書の要約を簡潔に生成し、コンテキスト長を短縮するとともに、重要な内容を保持する。
  • 次に、トレーニングコーパスから関連する例示文書およびそのアノテーションを意味的検索で抽出する。
  • 取得した例示文書とラベルを連結してfew-shotプロンプトを構築し、文脈内学習のシグナルを提供する。
  • LLMを用いて、入力文書とfew-shotの例示文書に基づき、最終的なラベルを予測する。これにより、チェーンされたプロンプトパイプラインが形成される。
  • プロンプトのチェーンを順次適用する:要約 → 検索 → 分類。これにより段階的推論が可能となり、コンテキスト認識能力が向上する。
  • コストを抑えるために、大規模モデルではなく、より小型なLLMs(例:GPT-NeoX、FLAN-UL2)を活用する。
Figure 1 : Prompt Chaining for Legal Document Classification
Figure 1 : Prompt Chaining for Legal Document Classification

実験結果

リサーチクエスチョン

  • RQ1ゼロショットプロンプトに比べて、プロンプトチェーニングは長文法的文書の分類性能を向上させるか?
  • RQ2構造的なプロンプトチェーニングを用いる場合、小型LLMsはGPT-3.5-turboのような大規模モデルをゼロショット設定で上回るか?
  • RQ3文書要約と例示文書の検索を活用することで、法的テキスト分類におけるラベル予測精度が向上するか?
  • RQ4few-shotプロンプトにおいて、頻度の高い法的問題分野と低頻度の分野の間で性能にどのような差が生じるか?
  • RQ5プロンプトチェーニングは、法的文書分類における解釈可能性とデバッグ性をどの程度向上させるか?

主な発見

  • プロンプトチェーニング手法は、SCOTUSテストセットでマイクロ-F1スコア0.779を達成し、ゼロショットのGPT-3.5-turboの0.438を上回った。
  • ECtHRデータセットでは、開発セットでマイクロ-F1が0.770、テストセットで0.779を記録し、ゼロショットのGPT-NeoXを上回った。
  • 頻度の高いクラス(例:刑事手続、連邦租税)では顕著に高い性能を示し、F1スコアはそれぞれ0.742と0.695であった。
  • テストセットにおけるマクロ-F1に低下が見られたが、マイクロ-F1は依然として強く保たれており、多数クラスに対する堅牢な性能を示した。
  • 混同行列から、市民権や司法権といった分野が「その他」に系統的に誤分類されていることが判明し、クラスの不均衡が課題であることが示された。
  • 本手法により、構造的なプロンプト生成と文脈内学習を用いることで、小型LLMsが大規模モデルを上回る性能を達成できることが実証された。
Figure 2 : Confusion matrix for the dev. set of ECHR .
Figure 2 : Confusion matrix for the dev. set of ECHR .

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。