[论文解读] PatentGPT: A Large Language Model for Intellectual Property
本文介绍了PatentGPT,这是一种在2400亿个token的知识产权数据上使用标准化训练流程微调的领域专用大语言模型。它在2019年中国专利代理人资格考试中得分65,表现优于GPT-4,并在长上下文任务中通过其MoE架构实现了更优的成本效率,性能与GPT-4相当。
In recent years, large language models(LLMs) have attracted significant attention due to their exceptional performance across a multitude of natural language process tasks, and have been widely applied in various fields. However, the application of large language models in the Intellectual Property (IP) domain is challenging due to the strong need for specialized knowledge, privacy protection, processing of extremely long text in this field. In this technical report, we present for the first time a low-cost, standardized procedure for training IP-oriented LLMs, meeting the unique requirements of the IP domain. Using this standard process, we have trained the PatentGPT series models based on open-source pretrained models. By evaluating them on the open-source IP-oriented benchmark MOZIP, our domain-specific LLMs outperforms GPT-4, indicating the effectiveness of the proposed training procedure and the expertise of the PatentGPT models in the IP domain. Remarkably, our model surpassed GPT-4 on the 2019 China Patent Agent Qualification Examination, scoring 65 and matching human expert levels. Additionally, the PatentGPT model, which utilizes the SMoE architecture, achieves performance comparable to that of GPT-4 in the IP domain and demonstrates a better cost-performance ratio on long-text tasks, potentially serving as an alternative to GPT-4 within the IP domain.
研究动机与目标
- 开发一种低成本、标准化的训练流程,用于知识产权(IP)领域专用大语言模型的训练。
- 解决知识产权应用中的独特挑战,包括专业领域知识、隐私约束以及对极长专利文本的处理。
- 训练并评估一系列针对知识产权优化的大型语言模型,使其在领域特定基准测试中超越通用模型(如GPT-4)。
- 证明稀疏专家混合(SMoE)架构在提升长上下文知识产权任务推理效率方面的作用,且不损失性能。
- 建立一个全面的基准测试集PatentBench,用于评估大语言模型在真实世界知识产权应用场景中的表现。
提出的方法
- 在2400亿个token的精选知识产权数据(包括专利、文件包装材料和技术文档)上,对基于LLaMA的开源模型(LLaMA2 13B、70B和Mixtral 8×7B)进行微调。
- 采用标准化训练流程,包括数据预处理、持续预训练、指令微调以及在领域特定基准上的评估。
- 使用4-bit量化和Text-Generation-Inference (TGI) 1.4,在A100 GPU上测量推理效率和资源消耗。
- 设计PatentGPT-1.0-MoE模型,采用稀疏专家混合架构,以减少内存使用并提升长序列上的推理速度。
- 在MOZIP基准和2019年中国专利代理人资格考试上评估模型,以衡量其在领域内的表现。
- 采用SMoE架构减少KV缓存的内存消耗,从而在FTO分析中的长文档对比任务中实现更好的可扩展性。

实验结果
研究问题
- RQ1是否可以通过标准化、低成本的训练流程,训练出在知识产权领域表现优于通用模型(如GPT-4)的领域专用大语言模型?
- RQ2在长上下文知识产权任务中,基于MoE的模型与密集模型在准确率和推理效率方面相比如何?
- RQ3微调后的较小模型在专业知识产权任务中,能在多大程度上达到与GPT-4等大模型相当的性能水平?
- RQ4在处理长专利文档时,模型架构(密集型 vs. MoE)对GPU内存使用量和响应延迟有何影响?
- RQ5像PatentBench这样的自定义基准测试,能否为真实世界知识产权应用中的大语言模型提供可靠且全面的评估?
主要发现
- PatentGPT-1.0-Dense(700亿参数)在2019年中国专利代理人资格考试中表现优于GPT-4,得分65,达到人类专家水平。
- PatentGPT模型在开源MOZIP基准测试中超越了GPT-4和ChatGPT-3.5-turbo,展现出在知识产权特定NLP任务中的卓越性能。
- PatentGPT-1.0-MoE在性能上与GPT-4相当,同时显著减少了GPU内存使用量,并表现出更低的响应延迟,尤其在长输入序列上表现更优。
- MoE架构有效降低了长输入序列下GPU内存使用量的增加,使其在专利对比等长上下文应用中更具效率。
- PatentGPT-1.0-MoE在成本-性能比方面优于密集模型,表明其在知识产权工作负载中作为GPT-4可扩展替代方案的潜力。
- 已建立PatentBench基准测试,作为专为真实世界知识产权应用场景(包括法律推理、文档撰写和现有技术分析)量身定制的综合性评估套件。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。