[论文解读] WeLM: A Well-Read Pre-trained Language Model for Chinese
WeLM 是一个参数量为 10B 的仅解码器预训练中文语言模型,基于精心筛选的高质量、多样化语料库进行训练,可在单语和多语任务中实现强大的零样本和少样本泛化能力。其性能优于同规模的其他模型,并达到参数量高达 25 倍的模型的水平,同时展现出在语言混用理解、自我解释和自我校准方面的能力。
Large Language Models pre-trained with self-supervised learning have demonstrated impressive zero-shot generalization capabilities on a wide spectrum of tasks. In this work, we present WeLM: a well-read pre-trained language model for Chinese that is able to seamlessly perform different types of tasks with zero or few-shot demonstrations. WeLM is trained with 10B parameters by "reading" a curated high-quality corpus covering a wide range of topics. We show that WeLM is equipped with broad knowledge on various domains and languages. On 18 monolingual (Chinese) tasks, WeLM can significantly outperform existing pre-trained models with similar sizes and match the performance of models up to 25 times larger. WeLM also exhibits strong capabilities in multi-lingual and code-switching understanding, outperforming existing multilingual language models pre-trained on 30 languages. Furthermore, We collected human-written prompts for a large set of supervised datasets in Chinese and fine-tuned WeLM with multi-prompted training. The resulting model can attain strong generalization on unseen types of tasks and outperform the unsupervised WeLM in zero-shot learning. Finally, we demonstrate that WeLM has basic skills at explaining and calibrating the decisions from itself, which can be promising directions for future research. Our models can be applied from https://welm.weixin.qq.com/docs/api/.
研究动机与目标
- 开发一个大规模、高质量预训练的中文语言模型,使其在无需任务特定微调的情况下,能有效泛化到多种自然语言处理任务。
- 通过精心筛选高质量、多样化的训练语料并扩大模型规模,提升中文自然语言处理任务中的零样本和少样本性能。
- 在涉及中文、英文和日文的多语言环境中,实现稳健的跨语言和语言混用理解能力。
- 研究并展示大型语言模型的自我解释和自我校准能力,以提升模型的可解释性和可靠性。
- 探索多提示微调对未见任务类型零样本泛化能力的影响。
提出的方法
- WeLM 作为仅解码器的自回归语言模型进行训练,采用标准的从左到右语言建模目标,基于一个精心筛选的 10B 参数训练语料库。
- 训练语料库从多样化来源(包括网络文本、学术写作和多语言内容)中精心筛选,通过数据来源平衡和质量过滤,确保广泛覆盖和高质量。
- 通过在大规模监督中文自然语言处理数据集中的真人编写提示上进行多提示微调,提升 WeLM 在未见任务类型上的零样本泛化能力。
- 通过提示模型生成其自身预测的解释,并评估其自身输出的正确性和毒性,来评估 WeLM 的自我解释和自我校准能力。
- 通过贪婪解码评估模型精确重现原始训练文本片段的能力,分析不同数据来源和词元频率下的记忆率,以衡量记忆化程度。
- 在 18 项单语中文任务、跨语言任务(如翻译、问答)以及语言混用基准上,将 WeLM 的性能与现有模型进行对比。
实验结果
研究问题
- RQ1一个大规模、精心筛选的中文预训练语言模型是否能在无需任务特定微调的情况下,实现对多样化自然语言处理任务的强大零样本和少样本泛化?
- RQ2WeLM 的性能与更大规模模型相比如何,特别是在中文自然语言处理基准上的零样本能力方面?
- RQ3WeLM 在涉及中文、英文和日文的多语言和语言混用场景中,理解与生成内容的能力达到何种程度?
- RQ4与无监督预训练版本相比,多提示微调是否能提升 WeLM 在未见任务类型上的零样本泛化能力?
- RQ5WeLM 是否展现出基本的自我解释和自我校准能力,例如为其自身预测生成解释,并识别错误或有毒输出?
主要发现
- WeLM 在 18 项单语中文自然语言处理任务中表现优于其他同规模的预训练模型,并达到参数量大 25 倍的 Ernie 3.0 Titan 模型的性能水平。
- 在包括机器翻译、问答和摘要在内的跨语言任务中,WeLM 的表现优于在 30 种语言上预训练的多语言模型 XGLM。
- WeLM 展现出强大的语言混用理解能力,能够以零样本方式成功翻译包含中文、英文和日文的混合语言输入。
- 对 WeLM 进行多提示微调后,其在未见任务类型上的零样本泛化能力得到提升,优于无监督预训练版本。
- WeLM 展现出基本的自我解释和自我校准能力:能够模仿解释风格,并正确判断其自身预测的正确性和毒性。
- 记忆化分析显示,更大的 WeLM 模型会记忆更多训练内容,且高频文本和来自 Common Crawl 等高比例数据源的内容记忆率更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。