Skip to main content
QUICK REVIEW

[论文解读] Legal Prompt Engineering for Multilingual Legal Judgement Prediction

Dietrich Trautmann, Alina Petrova|arXiv (Cornell University)|Dec 5, 2022
Artificial Intelligence in Law被引用 31
一句话总结

本文研究面向多语言法律判决预测的零-shot 法律提示工程,针对来自 ECHR(英文)和 FSCS(德语、法语、意大利语)的长篇法律文档,结果显示零-shot 提示优于简单基线,但落后于监督的最先进模型。

ABSTRACT

Legal Prompt Engineering (LPE) or Legal Prompting is a process to guide and assist a large language model (LLM) with performing a natural legal language processing (NLLP) skill. Our goal is to use LPE with LLMs over long legal documents for the Legal Judgement Prediction (LJP) task. We investigate the performance of zero-shot LPE for given facts in case-texts from the European Court of Human Rights (in English) and the Federal Supreme Court of Switzerland (in German, French and Italian). Our results show that zero-shot LPE is better compared to the baselines, but it still falls short compared to current state of the art supervised approaches. Nevertheless, the results are important, since there was 1) no explicit domain-specific data used - so we show that the transfer to the legal domain is possible for general-purpose LLMs, and 2) the LLMs where directly applied without any further training or fine-tuning - which in turn saves immensely in terms of additional computational costs.

研究动机与目标

  • 证明在长篇法律文档上进行零-shot 法律提示工程(LPE)用于法律判决预测(LJP)的可行性。
  • 在欧洲人权法院(英语)和瑞士联邦最高法院(德语、法语、意大利语)的数据集上评估多语言 LJP 的性能。
  • 评估在没有领域特定微调的情况下,零-shot LPE 与基线及监督的最先进结果的对比。

提出的方法

  • 使用离散的、人工的法律提示,将 LJP 转换为适用于长篇文档的自然语言问答任务。
  • 在没有数据特定训练的情况下,使用多语言大语言模型进行零-shot 提示(如 mGPT、GPT-J-6B、GPT-NeoX-20B)。
  • 通过迭代设计提示,引导模型输出朝向二元的是/否判断(A 对 B),同时处理非常长的输入(高达 2048 个标记)。
  • 在 ECHR(英语)和 FSCS(德语、法语、意大利语)上使用宏 F1、精确度、召回率等指标评估提示。
  • 分析完成示例,理解模型推理过程以及与真实标签不对齐的原因。

实验结果

研究问题

  • RQ1零-shot 法律提示工程(LPE)是否能够在无需任务特定微调的情况下,对长篇、真实世界的法院文档实现法律判决预测(LJP)?
  • RQ2在跨多语言法律数据集(ECHR 英语;FSCS 德语、法语、意大利语)上,零-shot LPE 相较于基线和监督模型的表现如何?
  • RQ3哪些提示设计和输出配置(例如 token 长度)能在零-shot LJP 中取得最佳的宏F1及相关指标?
  • RQ4模型完成结果表现出哪些定性特征(如列出的条文、解释等),以及它们与任务表现之间的关系?

主要发现

  • 使用 LLM 的零-shot LPE 在 LJP 的宏 F1、准确度和召回率方面优于简单基线,但仍低于监督的最先进结果。
  • 使用多语言 LLM(如 mGPT、GPT-J-6B、GPT-NeoX-20B)在英语、德语、法语、意大利语等语言上均有效的提示。
  • 长文档被截断为 2048 个标记;为获得最佳性能,需要对输出序列长度进行调优(最佳约 50 个标记)。
  • 完成结果存在变异,一些输出列出被违反的条文或提供解释,但没有单一案例同时匹配所有目标解释。
  • 与监督的全模型相比,零-shot 提示存在明显的性能差距,但在不进行额外微调或任务特定数据的情况下展示了领域迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。