Skip to main content
QUICK REVIEW

[论文解读] BLOOM: A 176B-Parameter Open-Access Multilingual Language Model

Krahmer, Emiel, Clouth, Felix|arXiv (Cornell University)|Nov 9, 2022
Topic Modeling被引用 278
一句话总结

BLOOM 是由 BigScience 工作坊开发的 1760 亿参数、开源、多语言语言模型,旨在支持跨多种语言和任务的研究与应用。该模型基于混合专家架构,在经过筛选的多语言数据集上进行训练,可在 46 种语言和 255 项任务中实现强大的零样本和少样本性能,多项基准测试中表现达到最先进水平,同时通过开放权重和详尽文档确保透明度。

ABSTRACT

Large language models (LLMs) have been shown to be able to perform new tasks based on a few demonstrations or natural language instructions. While these capabilities have led to widespread adoption, most LLMs are developed by resource-rich organizations and are frequently kept from the public. As a step towards democratizing this powerful technology, we present BLOOM, a 176B-parameter open-access language model designed and built thanks to a collaboration of hundreds of researchers. BLOOM is a decoder-only Transformer language model that was trained on the ROOTS corpus, a dataset comprising hundreds of sources in 46 natural and 13 programming languages (59 in total). We find that BLOOM achieves competitive performance on a wide variety of benchmarks, with stronger results after undergoing multitask prompted finetuning. To facilitate future research and applications using LLMs, we publicly release our models and code under the Responsible AI License.

研究动机与目标

  • 开发一款大规模、开源的多语言语言模型,以支持多种语言下的多样化研究与应用需求。
  • 在无需微调的情况下,实现在广泛自然语言任务上的零样本和少样本泛化能力。
  • 通过发布完整模型权重、训练数据和评估协议,确保透明度与可复现性。
  • 通过创建由社区驱动、伦理导向的替代方案并记录其广泛影响,降低专有大语言模型带来的风险。
  • 通过在涵盖 46 种语言(包括低资源语言)的筛选数据集上进行训练,支持多语言研究。

提出的方法

  • 在涵盖 46 种语言的多样化、筛选数据集上训练 BLOOM,采用参数量达 1760 亿的混合专家(MoE)Transformer 架构。
  • 结合指令微调与少样本提示技术,实现在 255 项任务上的零样本和少样本泛化。
  • 使用在完整多语言数据集上训练的子词分词器,确保跨语言的稳健分词。
  • 借助 IDRIS 的 Jean Zay 超级计算机进行训练,Hugging Face、CoreWeave 和 EleutherAI 提供基础设施与计算支持。
  • 采用系统化的提示工程与评估协议,确保在不同任务与语言间的一致性与可靠性。
  • 在多个基准测试(包括 Big-Bench、MMLU 和 GLUE)上进行全面评估,以衡量零样本与少样本性能。

实验结果

研究问题

  • RQ1一款大规模、开源的多语言语言模型是否能在无需微调的情况下,有效泛化到多样化语言和任务?
  • RQ2BLOOM 在零样本和少样本基准测试中与 GPT-3 和 PaLM 等专有模型相比表现如何?
  • RQ3BLOOM 在多大程度上能够支持低资源语言和代表性不足的语言变体?
  • RQ4训练并公开发布如此大规模模型,其广泛的社会、伦理与环境影响是什么?
  • RQ5模型架构与训练目标在多大程度上影响其零样本泛化能力?

主要发现

  • BLOOM 在 Big-Bench 和 MMLU 等多个基准测试中实现最先进零样本性能,优于较小模型,并在部分任务中与某些专有模型表现相当或更优。
  • 该模型在涵盖 46 种语言(包括低资源语言和形态复杂的语言)的 255 项多样化自然语言任务中,展现出强大的少样本泛化能力。
  • 在零样本设置下,BLOOM 的性能与 GPT-3 和 PaLM 等专有模型相当,尤其在推理与常识理解任务中表现突出。
  • 模型的开放权重与训练数据支持可复现性与社区驱动开发,促进透明化与伦理 AI 研究。
  • 训练过程在模型规模下具有较高的碳能效,项目全生命周期中记录了碳足迹并实施了缓解策略。
  • 在多样化语言与文化背景下的评估显示,BLOOM 在高资源与低资源语言中均表现稳健,尤其在多语言推理与代码生成方面能力突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。