[论文解读] Legal Prompting: Teaching a Language Model to Think Like a Lawyer
该论文评估 GPT-3 在 COLIEE 任务上的零-shot、少-shot 与微调提示用于法律推理,发现法律推理提示(如基于 IRAC 的)效果最好,相对于此前 COLIEE 获胜者有显著提升。
Large language models that are capable of zero or few-shot prompting approaches have given rise to the new research area of prompt engineering. Recent advances showed that for example Chain-of-Thought (CoT) prompts can improve arithmetic or common sense tasks significantly. We explore how such approaches fare with legal reasoning tasks and take the COLIEE entailment task based on the Japanese Bar exam for testing zero-shot/few-shot and fine-tuning approaches. Our findings show that while CoT prompting and fine-tuning with explanations approaches show improvements, the best results are produced by prompts that are derived from specific legal reasoning techniques such as IRAC (Issue, Rule, Application, Conclusion). Based on our experiments we improve the 2021 best result from 0.7037 accuracy to 0.8148 accuracy and beat the 2022 best system of 0.6789 accuracy with an accuracy of 0.7431.
研究动机与目标
- 研究 prompting 技术如何影响大型语言模型的法律推理任务。
- 使用 COLIEE 2021 与 2022 数据评估零-shot、少-shot 和微调方法。
- 确定哪些提示设计最能捕捉标准法律推理(如 IRAC)以提高准确性。
- 将基于提示的方法与 COLIEE 的 state-of-the-art 结果进行比较,并分析跨年度的一致性。
提出的方法
- 使用 GPT-3(text-davinci-002)对 2021 与 2022 测试集执行 COLIEE Task 4(蕴含推理/entailment)。
- 在是否包含领域特定法律推理提示的情况下评估零-shot 提示。
- 使用来自律师考试博客数据集的 1、3、和 8 个演示进行少-shot 提示评估。
- 用二进制标签进行微调 GPT-3,且带/不带解释。
- 在零-shot中测试 chain-of-thought 提示(ZS-CoT)并评估两阶段推理提示。
- 将受 IRAC 风格模式启发的法律推理提示(LR 提示,诸如 TRRAC、IRREAC、IRRAC 等)应用于 ZS 设置。
- 将带伪解释的微调与 GPT-3 生成的解释与没有解释的指令提示进行比较。
实验结果
研究问题
- RQ1零-shot、少-shot 与微调提示在使 GPT-3 能在 COLIEE 数据上执行法律蕴含推理方面的表现如何?
- RQ2哪些法律推理提示结构(如 IRAC 变体)在 COLIEE 2021 与 2022 上能最大化准确性?
- RQ3在微调过程中提供解释或推理过程是否能在跨年度中稳定提升性能?
- RQ4提示基方法在不同 COLIEE 年份中的相对鲁棒性如何?
主要发现
- 零-shot 法律推理提示(如 TRRAC)获得显著提升,尤其在 2021 COLIEE 上达到 0.8148 的准确度,较 2021 年的赢家提升 0.815 点。
- IRREAC 与 IRRAC 在 2022 COLIEE 上达到 0.7156 的准确度,超越 2022 年赢家 0.041 点。
- 八-shot 少-shot 提示在 2022 数据上表现最佳,准确度为 0.7431,超越 2022 年赢家(0.6789)0.0642 点。
- 用指令性提示进行微调在 2021 测试集上的相对增益可达到约 24% 之多,优于其他微调配置。
- GPT-3 可以在多种提示模式下生成解释,但带指令性提示的微调且不使用外部解释时通常表现最好。
- 少-shot 方法在两年中提供比单独零-shot提示更一致的增益,而零-shot提示在某些年份显示出特定的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。