Skip to main content
QUICK REVIEW

[論文レビュー] Legal Prompting: Teaching a Language Model to Think Like a Lawyer

Fangyi Yu, Lee Quartey|arXiv (Cornell University)|Dec 2, 2022
Artificial Intelligence in Law被引用数 34
ひとこと要約

本論文は、COLIEE 課題における GPT-3 を用いた法的推論に対する zero-shot、few-shot、およびファインチューニングプロンプトを評価し、法的推論プロンプト(例:IRAC ベース)が最良の結果を生み出し、以前の COLIEE 優勝者と比較して有意な改善をもたらすことを示している。

ABSTRACT

Large language models that are capable of zero or few-shot prompting approaches have given rise to the new research area of prompt engineering. Recent advances showed that for example Chain-of-Thought (CoT) prompts can improve arithmetic or common sense tasks significantly. We explore how such approaches fare with legal reasoning tasks and take the COLIEE entailment task based on the Japanese Bar exam for testing zero-shot/few-shot and fine-tuning approaches. Our findings show that while CoT prompting and fine-tuning with explanations approaches show improvements, the best results are produced by prompts that are derived from specific legal reasoning techniques such as IRAC (Issue, Rule, Application, Conclusion). Based on our experiments we improve the 2021 best result from 0.7037 accuracy to 0.8148 accuracy and beat the 2022 best system of 0.6789 accuracy with an accuracy of 0.7431.

研究の動機と目的

  • 大規模言語モデルにおける prompting 技術が法的推論タスクへ与える影響を調査する。
  • COLIEE 2021 および 2022 データを用いて zero-shot、few-shot、およびファインチューニング手法を評価する。
  • 標準的な法的推論(例:IRAC)を最もよく捉えるプロンプト設計を特定し、精度向上につなげる。
  • prompting ベースの手法を COLIEE の最先端結果と比較し、年を超えた一貫性を分析する。

提案手法

  • GPT-3 (text-davinci-002) を用いて COLIEE Task 4 (entailment) を 2021 年および 2022 年のテストセットで実行する。
  • 領域固有の法的推論プロンプトの有無を問わず、ゼロショットプロンプトを評価する。
  • 法曹試験ブログデータセットからの 1、3、8 個のデモを用いた few-shot プロンプトを評価する。
  • バイナリラベルと説明の有無で GPT-3 をファインチューニングする。
  • チェーンオブソートを用いたゼロショット(ZS-CoT)を試し、二段階推論プロンプトを評価する。
  • IRAC スタイルのスキーマに触発された法的推論プロンプト(LR プロンプト;例:TRRAC、IRREAC、IRRAC)を ZS 環境に適用する。
  • 擬似説明や GPT-3 が生成した説明を用いたファインチューニングを、説明なしの instructional prompts と比較する。

実験結果

リサーチクエスチョン

  • RQ1COLIEE データ上で GPT-3 が法的含意を実行できるよう、zero-shot、few-shot、およびファインチューニングプロンプトはいかに比較されるか。
  • RQ2COLIEE 2021 および 2022 で精度を最大化する法的推論プロンプト構造(例:IRAC 系統)はどれか。
  • RQ3ファインチューニング時に説明や推論根拠を用いることは、年を超えて一貫して性能を向上させるか。
  • RQ4異なる COLIEE 年におけるプロンプトベースの手法の相対的な頑健性はどの程度か。

主な発見

  • ゼロショットの法的推論プロンプト(例:TRRAC)は顕著な改善をもたらし、2021 COLIEE で特に 0.8148 の精度を達成し、2021 年の優勝者を 0.815 ポイント上回る。
  • IRREAC および IRRAC アプローチは 2022 COLIEE で 0.7156 の精度に達し、2022 年の優勝者を 0.041 ポイント上回る。
  • 8-shot の few-shot prompting が 2022 データで総合最高の性能を達成し、0.7431 の精度で、2022 年の優勝者 (0.6789) を 0.0642 ポイント上回る。
  • instructional prompts を用いたファインチューニングは、2021 テストセットで他のファインチューニング設定より最大約 ~24% 相対向上を達成。
  • GPT-3 はプロンプトモード全体で説明を生成できるが、外部の説明なしで instructional prompts を用いたファインチューニングがしばしば最良の性能を示す。
  • Few-shot アプローチは年を問わず zero-shot のみよりも一貫した改善をもたらす一方、zero-shot は年特有の優位性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。