[论文解读] DISC-LawLLM: Fine-tuning Large Language Models for Intelligent Legal Services
DISC-LawLLM 在中文领域的 13B 基础 LLM 上进行微调,使用法律三段论提示和检索增强,提升法律推理能力和访问外部知识的能力,并以专门的 DISC-Law-Eval 基准进行评估。
We propose DISC-LawLLM, an intelligent legal system utilizing large language models (LLMs) to provide a wide range of legal services. We adopt legal syllogism prompting strategies to construct supervised fine-tuning datasets in the Chinese Judicial domain and fine-tune LLMs with legal reasoning capability. We augment LLMs with a retrieval module to enhance models' ability to access and utilize external legal knowledge. A comprehensive legal benchmark, DISC-Law-Eval, is presented to evaluate intelligent legal systems from both objective and subjective dimensions. Quantitative and qualitative results on DISC-Law-Eval demonstrate the effectiveness of our system in serving various users across diverse legal scenarios. The detailed resources are available at https://github.com/FudanDISC/DISC-LawLLM.
研究动机与目标
- 激励搭建能够提供广泛法律服务、超越单一任务的智能法律系统。
- 使用法律三段论提示来建立 DISC-Law-SFT 数据集,灌输法律推理给 LLM。
- 纳入检索模块以获取最新法律知识并减少幻觉。
- 提出一个全面的 DISC-Law-Eval 基准,用于对法律 AI 系统进行客观和主观评估。
- 证明 DISC-LawLLM 在基准测试上优于现有的法律大模型。
提出的方法
- 构建 DISC-Law-SFT 数据集,包含两个子集,以编码法律推理和知识检索能力。
- 在 DISC-Law-SFT 上对 Baichuan-13B-Base 进行有监督微调,使用指定超参数进行微调。
- 在一个中国法律知识库之上引入检索增强模块,在生成时提供参考。
- 使用 DISC-Law-SFT-Triplet 来训练模型以实现检索感知推理。
- 开发 DISC-Law-Eval,包含客观部分(跨难度等级的多项选择题)和主观部分(与 GPT-3.5 裁判的问答)组件。
实验结果
研究问题
- RQ1DISC-LawLLM 能否在遵循法律三段论结构的前提下,进行稳健的中文法律推理?
- RQ2检索增强是否提升法律回答的可靠性和事实依据?
- RQ3在客观知识和主观质量指标上,DISC-LawLLM 与现有通用和法律大模型相比如何?
- RQ4DISC-Law-Eval 基准在评估专业人士、公众和学生的多样化法律服务方面是否有效?
主要发现
- 在多法学科和不同难度等级的客观评估中,具备检索增强的 DISC-LawLLM 显著优于竞争对手的大模型。
- 与 GPT-3.5-turbo (175B) 相比,DISC-LawLLM 在大多数客观科目上表现更出色,在困难的 NJE 和 PAE 项目上有显著提升。
- 主观评估显示,DISC-LawLLM 在准确性、完整性和清晰度评分上优于若干法律大模型和通用大模型。
- 该模型通过法律三段论提示展现出强烈的法理推理能力,并通过基于检索的参考提升可靠性。
- 该方法在实际场景中能作为有效的法律专业工具、咨询和考试辅助。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。