[论文解读] Efficient Continual Pre-training for Building Domain Specific Large Language Models
本文提出了高效的持续预训练方法——ETS-DACP 和 ETA-DACP,用于构建领域特定的大规模语言模型,证明了选择性数据筛选可在仅使用原始持续预训练 10% 的数据和成本下,显著提升金融任务性能,同时保持开放领域能力。
Large language models (LLMs) have demonstrated remarkable open-domain capabilities. LLMs tailored for a domain are typically trained entirely on domain corpus to excel at handling domain-specific tasks. In this work, we explore an alternative strategy of continual pre-training as a means to develop domain-specific LLMs over an existing open-domain LLM. We introduce FinPythia-6.9B, developed through domain-adaptive continual pre-training on the financial domain. Continual pre-trained FinPythia showcases consistent improvements on financial tasks over the original foundational model. We further explore simple but effective data selection strategies for continual pre-training. Our data selection strategies outperform vanilla continual pre-training's performance with just 10% of corpus size and cost, without any degradation on open-domain standard tasks. Our work proposes an alternative solution to building domain-specific LLMs cost-effectively.
研究动机与目标
- 探究领域自适应的持续预训练是否能有效构建高性能的领域特定大语言模型,特别是在金融等低数据领域。
- 通过探索持续预训练作为更具成本效益的替代方案,解决从零开始训练领域特定大语言模型所面临的高成本和数据效率低下问题。
- 开发数据筛选策略,提升持续预训练效率,无需任务特定数据,且不牺牲开放领域性能。
- 评估持续预训练是否会对标准基准测试中的通用语言能力造成损害。
- 建立一个可扩展、低成本的管道,利用预训练基础模型和针对性的数据筛选,构建领域特定的大语言模型。
提出的方法
- 从公开来源收集了包含 160 亿词的大规模金融语料库:通过 CommonCrawl 获取金融新闻,通过 SEC 文件获取监管文件,并通过去重处理提升训练效率。
- 提出了 ETS-DACP(任务感知)和 ETA-DACP(任务无关)方法,利用相似性、困惑度和标记类型熵来筛选高价值训练样本,用于持续预训练。
- 在 Pythia-6.9B 基础模型上应用持续预训练,使用筛选后的金融数据进行微调,实现领域特定分布的适应,而无需从头开始训练。
- 采用三种数据筛选指标:(1) 与任务数据的语义相似性(用于 ETS-DACP),(2) 困惑度(用于 ETS-DACP 和 ETA-DACP-ppl),(3) 标记类型熵(用于 ETA-DACP-ent),实现无需任务标签的通用数据筛选。
- 在金融基准和标准开放领域任务(如 MMLU、TruthfulQA)上评估性能,以衡量领域适应性和能力保留情况。
- 对比原始持续预训练、ETS-DACP 和 ETA-DACP 变体在使用 10% 全部领域语料库情况下的结果,评估成本-性能权衡。

实验结果
研究问题
- RQ1与原始基础模型相比,领域自适应的持续预训练是否能有效提升金融任务的性能?
- RQ2数据筛选策略是否能显著降低训练成本和数据量,同时在性能上优于原始持续预训练?
- RQ3在领域数据上进行持续预训练是否会损害模型在开放领域标准基准测试中的表现?
- RQ4与基于相似性的任务感知筛选相比,任务无关的筛选指标(如困惑度、熵)的有效性如何?
- RQ5持续预训练能否使模型获取并保留最新的金融领域知识?
主要发现
- 通过在原始 Pythia 训练数据大小 8% 的数据上进行持续预训练,FinPythia-6.9B 在金融基准测试中相较于基础 Pythia 模型实现了持续的性能提升。
- ETS-DACP 和 ETA-DACP 方法在仅使用领域语料库 10% 的情况下,优于原始持续预训练,实现了显著更低的成本和更少的数据量,同时获得更优结果。
- ETA-DACP 使用困惑度和熵作为任务无关的筛选标准,其性能几乎与任务感知的 ETS-DACP 相当,实现了无需标注任务数据即可进行数据筛选。
- 在 MMLU、TruthfulQA 和 HellaSwag 等开放领域基准测试中未观察到显著性能下降,表明持续预训练能够保留通用语言能力。
- 定性分析证实,FinPythia 能够成功获取并保留最新的金融知识,包括近期的市场动态和监管发展。
- 使用领域数据 10%(23.9 亿 token)训练的模型在金融任务上达到了最先进性能,证明了在不牺牲性能的前提下,数据效率和成本降低是可实现的。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。