Skip to main content
QUICK REVIEW

[论文解读] Large Language Model Prompt Chaining for Long Legal Document Classification

Dietrich Trautmann|arXiv (Cornell University)|Aug 8, 2023
Topic Modeling被引用 7
一句话总结

本文提出了一种提示链框架,用于使用大型语言模型(LLMs)进行少样本上下文学习,对长篇法律文档进行分类,该框架利用文档摘要、样本的语义检索以及迭代提示。在两个法律文本分类任务中,其微F1分数高于零样本的GPT-3.5-turbo(ChatGPT),甚至优于使用更小、更高效的LLMs的更大模型。

ABSTRACT

Prompting is used to guide or steer a language model in generating an appropriate response that is consistent with the desired outcome. Chaining is a strategy used to decompose complex tasks into smaller, manageable components. In this study, we utilize prompt chaining for extensive legal document classification tasks, which present difficulties due to their intricate domain-specific language and considerable length. Our approach begins with the creation of a concise summary of the original document, followed by a semantic search for related exemplar texts and their corresponding annotations from a training corpus. Finally, we prompt for a label - based on the task - to assign, by leveraging the in-context learning from the few-shot prompt. We demonstrate that through prompt chaining, we can not only enhance the performance over zero-shot, but also surpass the micro-F1 score achieved by larger models, such as ChatGPT zero-shot, using smaller models.

研究动机与目标

  • 为解决具有专业语言和结构的长篇复杂法律文档分类挑战。
  • 通过利用少样本提示减少对昂贵微调和专家标注数据集的依赖。
  • 通过模块化、可解释的提示链策略,提升零样本提示的分类性能。
  • 评估更小的LLMs是否可通过结构化提示在零样本设置下超越像GPT-3.5-turbo这样的大模型。
  • 证明在真实世界基准下,提示链在法律NLP任务中的可行性和有效性。

提出的方法

  • 首先,生成输入法律文档的简洁摘要,以减少上下文长度并保留关键内容。
  • 然后,执行语义搜索,从训练语料库中检索相关样本文档及其标注。
  • 通过拼接检索到的样本及其标签,构建少样本提示,提供上下文学习信号。
  • 使用LLM基于输入文档和少样本样本预测最终标签,形成链式提示流水线。
  • 按顺序应用提示链:摘要 → 检索 → 分类,实现逐步推理并提升上下文感知能力。
  • 使用更小的LLMs(如GPT-NeoX、FLAN-UL2)而非更大模型,以降低计算成本,同时保持或提升性能。
Figure 1 : Prompt Chaining for Legal Document Classification
Figure 1 : Prompt Chaining for Legal Document Classification

实验结果

研究问题

  • RQ1与零样本提示相比,提示链是否能提升长篇法律文档的分类性能?
  • RQ2当使用结构化提示链时,更小的LLMs是否能在零样本设置下超越像GPT-3.5-turbo这样的大模型?
  • RQ3文档摘要和样本检索的使用是否能提升法律文本分类中的标签预测准确率?
  • RQ4在少样本提示中,性能在高频与低频法律议题类别之间如何变化?
  • RQ5提示链在多大程度上提升了法律文档分类的可解释性和可调试性?

主要发现

  • 在SCOTUS测试集上,提示链方法实现了0.779的微F1分数,超过零样本GPT-3.5-turbo的0.438。
  • 在ECtHR数据集上,该方法在开发集上达到0.770的微F1,在测试集上达到0.779,优于零样本的GPT-NeoX。
  • 模型在高频类别(如刑事诉讼、联邦税收)上表现显著更优,F1分数分别为0.742和0.695,而低频类别则表现较弱。
  • 尽管测试集上的宏F1有所下降,但微F1保持强劲,表明对多数类别的鲁棒性能。
  • 混淆矩阵显示,诸如公民权利和司法权力等议题领域常被系统性地误分类为“其他”类别,表明类别不平衡构成挑战。
  • 该方法表明,当结合结构化提示和上下文学习时,更小的LLMs可实现优于大模型的性能。
Figure 2 : Confusion matrix for the dev. set of ECHR .
Figure 2 : Confusion matrix for the dev. set of ECHR .

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。