[论文解读] LexGPT 0.1: pre-trained GPT-J models with Pile of Law
本文介绍了 LexGPT 0.1,这是一组基于 GPT-J 的语言模型,其在 Pile of Law 数据集上进行预训练,专精于法律文本生成与分类。通过无需代码修改的“无代码”方法进行微调,该模型在 LEDGAR 上实现了 83.9% 的 micro-F1,在 CaseHOLD 上实现了 49.6% 的准确率,证明了法律专业人士可借助极少技术专长部署自定义分类器,尽管性能仍落后于基于 BERT 的最先进模型。
This research aims to build generative language models specialized for the legal domain. The manuscript presents the development of LexGPT models based on GPT-J models and pre-trained with Pile of Law. The foundation model built in this manuscript is the initial step for the development of future applications in the legal domain, such as further training with reinforcement learning from human feedback. Another objective of this manuscript is to assist legal professionals in utilizing language models through the ``No Code'' approach. By fine-tuning models with specialized data and without modifying any source code, legal professionals can create custom language models for downstream tasks with minimum effort and technical knowledge. The downstream task in this manuscript is to turn a LexGPT model into a classifier, although the performance is notably lower than the state-of-the-art result. How to enhance downstream task performance without modifying the model or its source code is a research topic for future exploration.
研究动机与目标
- 使用 Pile of Law 数据集开发专用于法律领域的生成式语言模型。
- 使法律专业人士能够在不修改源代码的情况下创建自定义语言模型,支持“无代码”方法。
- 使用 LexGLUE 基准评估微调后的 LexGPT 模型在下游法律分类任务中的表现。
- 探索在未添加分类头的情况下,对 GPT 模型进行零样本微调与传统基于 BERT 的模型(附加分类头)之间的性能差距。
- 识别将生成式模型应用于多标签和长序列法律任务时面临的挑战。
提出的方法
- 在 256GB 的 Pile of Law 数据集(一个精选的法律与行政文本语料库)上,仅对 GPT-J 模型(456M 和 1.6B 参数)进行预训练。
- 使用标准的 Hugging Face 训练管道,在下游法律分类任务(LEDGAR 和 CaseHOLD)上对预训练模型进行微调,且不修改模型架构。
- 采用基于提示的分类策略,其中每个输入为上下文-提示对,搭配候选标签,模型通过预测下一个标记来选择正确标签。
- 使用零样本提示格式,模型直接从输入生成标签标记,避免架构更改或添加额外分类头。
- 使用 LEDGAR 上的 micro-F1 和 macro-F1 分数以及 CaseHOLD 上的准确率评估性能,并与现有基于 BERT 的模型进行比较。
- 由于架构和序列长度限制,排除了包含长序列的语料库(ECtHR、SCOTUS)以及多标签任务(EUR-LEX、UNFAIR-ToS)。

实验结果
研究问题
- RQ1在不修改架构的前提下,基于 Pile of Law 数据集预训练的 GPT-J 模型是否能在法律文本分类任务中实现具有竞争力的性能?
- RQ2“无代码”微调方法在多大程度上可使法律专业人士在极少技术专长的情况下部署自定义语言模型?
- RQ3为何微调后的 GPT 模型在法律自然语言理解基准测试中表现不如带有专用分类头的基于 BERT 的模型?
- RQ4序列长度和多标签分类设置在多大程度上影响生成式模型(如 LexGPT)在法律自然语言处理任务中的性能?
- RQ5在不修改架构的前提下,思维链提示(chain-of-thought prompting)能否提高分类准确率?
主要发现
- 1.6B 参数的 LexGPT 模型在 LEDGAR 单标签分类任务中取得了 83.9% 的 micro-F1 和 74.0% 的 macro-F1,优于 456M 模型(83.5% micro-F1,72.4% macro-F1)。
- 在 CaseHOLD 多选分类任务中,456M 模型达到了 49.6% 的准确率,显著高于随机猜测(20%),但远低于最先进模型 CaseLaw-BERT 的 75.4% 准确率。
- 尽管代码修改极少,LexGPT 与最先进基于 BERT 的模型之间的性能差距依然存在,表明基于提示的微调在分类任务中存在局限性。
- 由于模型输入长度限制以及与自回归生成的不兼容性,长序列数据集(ECtHR、SCOTUS)和多标签任务(EUR-LEX、UNFAIR-ToS)被排除。
- 本研究证实,GPT 基模型可通过基于提示的微调方式适应法律分类任务,且无需代码更改,验证了法律从业者采用“无代码”方法的可行性。
- 未来工作需探索思维链提示或专用数据格式是否能缩小与基于 BERT 模型的性能差距。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。