Skip to main content
QUICK REVIEW

[論文レビュー] LexGPT 0.1: pre-trained GPT-J models with Pile of Law

Jieh-Sheng Lee|arXiv (Cornell University)|Jun 5, 2023
Artificial Intelligence in Law被引用数 4
ひとこと要約

本稿では、Pile of Lawデータセットを用いて事前学習されたGPT-Jベースの言語モデルであるLexGPT 0.1を紹介する。このモデル群は、法的文書生成および分類に特化しており、コード変更なしに『No Code』アプローチで微調整可能である。LEDGARでは83.9%のmicro-F1、CaseHOLDでは49.6%の正答率を達成し、技術的熟練を要しない法的専門家によるカスタム分類器の展開が可能であることを示しているが、BERTベースの最先端モデルに比べて性能が劣ることが判明した。

ABSTRACT

This research aims to build generative language models specialized for the legal domain. The manuscript presents the development of LexGPT models based on GPT-J models and pre-trained with Pile of Law. The foundation model built in this manuscript is the initial step for the development of future applications in the legal domain, such as further training with reinforcement learning from human feedback. Another objective of this manuscript is to assist legal professionals in utilizing language models through the ``No Code'' approach. By fine-tuning models with specialized data and without modifying any source code, legal professionals can create custom language models for downstream tasks with minimum effort and technical knowledge. The downstream task in this manuscript is to turn a LexGPT model into a classifier, although the performance is notably lower than the state-of-the-art result. How to enhance downstream task performance without modifying the model or its source code is a research topic for future exploration.

研究の動機と目的

  • Pile of Lawデータセットを用いて、法的ドメインに特化した生成型言語モデルを開発すること。
  • 法的専門家がソースコードの変更なしにカスタム言語モデルを構築できるようにし、『No Code』アプローチを支援すること。
  • LexGLUEベンチマークを用いて、微調整されたLexGPTモデルの下流法的分類タスクにおける性能を評価すること。
  • 生成型モデルのゼロショット微調整と、分類ヘッドを追加した従来のBERTベースのモデルとの間の性能格差を調査すること。
  • 生成型モデルをマルチラベルおよび長文シーケンス処理タスクに適応させる際の課題を同定すること。

提案手法

  • 256GBのPile of Lawデータセット(規範的・行政的テキストコーパス)に限定して、456Mおよび1.6BパラメータのGPT-Jモデルを事前学習する。
  • モデルアーキテクチャの変更なしに、標準のHugging Faceトレーニングパイプラインを用いて、下流の法的分類タスク(LEDGARおよびCaseHOLD)で微調整を行う。
  • プロンプトベースの分類戦略を適用し、各入力は文脈プロンプトと候補ラベルのペアとして与えられ、モデルは次に出現するトークンを予測することで正しいラベルを選択する。
  • モデルが入力から直接ラベルトークンを生成するゼロショットプロンプト形式を採用し、アーキテクチャの変更や追加分類ヘッドを回避する。
  • LEDGARではmicro-F1およびmacro-F1スコア、CaseHOLDでは正答率を用いて性能を評価し、既存のBERTベースのモデルと比較する。
  • モデル入力長の制限および自己回帰的生成との不適合性のため、長文シーケンスデータセット(ECtHR、SCOTUS)およびマルチラベルタスク(EUR-LEX、UNFAIR-ToS)は除外した。
Figure 1: Training loss
Figure 1: Training loss

実験結果

リサーチクエスチョン

  • RQ1Pile of Lawデータセットで事前学習されたGPT-Jモデルは、アーキテクチャの変更なしに、法的テキスト分類タスクで競争力のある性能を達成できるか?
  • RQ2『No Code』微調整アプローチが、技術的熟練を要しない法的専門家がカスタム言語モデルを展開できるまでの到達度はどの程度か?
  • RQ3なぜ、分類ヘッドを追加したBERTベースのモデルに比べ、微調整済みのGPTモデルは法的NLUベンチマークで性能が劣るのか?
  • RQ4シーケンス長およびマルチラベル分類設定が、生成型モデル(LexGPT)の法的NLPタスクにおける性能にどのように影響を与えるか?
  • RQ5アーキテクチャの変更なしに、チェーン・オブ・トゥーク(Chain-of-Thought)プロンプトが分類精度を向上させられるか?

主な発見

  • 1.6BパラメータのLexGPTモデルは、LEDGARの単一ラベル分類タスクで83.9%のmicro-F1、74.0%のmacro-F1を達成し、456Mモデル(83.5%のmicro-F1、72.4%のmacro-F1)を上回った。
  • CaseHOLDの複数選択分類タスクでは、456Mモデルが49.6%の正答率を達成し、ランダム推測(20%)をはるかに上回ったが、最先端のSOTA CaseLaw-BERTモデル(75.4%正答率)には大きく劣った。
  • 最小限のコード変更でさえも、LexGPTと最先端のBERTベースのモデルとの間で性能格差が継続していることから、分類タスクにおけるプロンプトベースの微調整に限界があることが示された。
  • 長文シーケンスデータセット(ECtHR、SCOTUS)およびマルチラベルタスク(EUR-LEX、UNFAIR-ToS)は、モデルの入力長制限および自己回帰的生成との不適合性のため除外された。
  • 本研究は、コード変更なしにプロンプトベースの微調整によりGPTベースのモデルを法的分類タスクに適応可能であることを確認し、法的実務家が『No Code』アプローチを活用できることが裏付けられた。
  • 今後の課題として、チェーン・オブ・トゥークプロンプトや特化したデータフォーマットの活用が、BERTベースのモデルとの性能格差を埋める可能性を調査する必要がある。
Figure 2: Training loss
Figure 2: Training loss

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。