Skip to main content
QUICK REVIEW

[论文解读] GPT-SW3: An Autoregressive Language Model for the Nordic Languages

Ariel Ekgren, Amaru Cuba Gyllensten|arXiv (Cornell University)|May 22, 2023
Scientific Computing and Data Management被引用 4
一句话总结

GPT-SW3 是首个针对北日耳曼语言的原生自回归大语言模型,基于涵盖瑞典语、挪威语、丹麦语、冰岛语和英语的多语言及代码数据,训练了3200亿 tokens。该模型参数量从1.26亿到400亿不等,并提供指令微调版本。通过精心筛选的数据收集、合规意识的数据处理以及国家超级计算基础设施的支持,该模型为资源较少的北日耳曼语言提供了一种透明、以开放研究为导向的替代方案,以应对专有模型的局限。

ABSTRACT

This paper details the process of developing the first native large generative language model for the Nordic languages, GPT-SW3. We cover all parts of the development process, from data collection and processing, training configuration and instruction finetuning, to evaluation and considerations for release strategies. We hope that this paper can serve as a guide and reference for other researchers that undertake the development of large generative models for smaller languages.

研究动机与目标

  • 开发首个针对北日耳曼(北日耳曼)语言的原生大语言模型,以应对小型欧洲语言缺乏多语言大语言模型的问题。
  • 克服在收集高质量、多样化北欧语言文本时面临的数据稀缺与监管挑战(例如 GDPR、版权问题)。
  • 利用国家超级计算基础设施(如 Berzelius、SNIC)进行训练,确保北欧研究的可访问性与可持续性。
  • 建立一种透明、以开放研究为导向的发布策略,平衡开放性与负责任人工智能的原则。
  • 使北欧自然语言处理社区能够访问、验证并扩展一个原生大语言模型,以实现文化与语言代表性。

提出的方法

  • 构建了《北欧语料集》(The Nordic Pile),一个从新闻、书籍和代码等多种来源精心筛选的约3200亿 token 的数据集,采用语言特定的过滤与去重处理。
  • 使用多语言分词器处理数据,并应用严格过滤机制,以确保数据质量并符合 GDPR 和版权法规。
  • 在国家高性能计算基础设施(Berzelius)上,通过 NeMo Megatron 框架,使用因果语言建模方法训练解码器-only 的 Transformer 模型。
  • 使用精心筛选的指令数据集对选定模型进行指令微调,以提升零样本与少样本能力。
  • 实施受限预发布策略,通过人工申请审核,并采用修改版 BigScience RAIL 许可证,以确保负责任的研究访问。
  • 通过在公共艺术展览中部署 Klara 聊天机器人,开展真实世界验证,收集超过 7000 次用户交互,以评估生成质量与社会影响。

实验结果

研究问题

  • RQ1如何在现有训练数据有限且受监管约束的条件下,为北欧语言开发高质量、大规模的语言模型?
  • RQ2在国家大语言模型项目中,如何在数据开放性、合规性(如 GDPR)与模型可访问性之间实现最佳平衡?
  • RQ3国家 HPC 基础设施能否在不依赖商业云服务提供商的情况下,支持为低资源语言训练 400 亿参数的大语言模型?
  • RQ4指令微调如何提升北欧大语言模型在多种语言与任务上的零样本与少样本性能?
  • RQ5生成式大语言模型在公共与文化语境中的社会与实践验证路径是什么?

主要发现

  • GPT-SW3 是首个基于涵盖五种北欧语言和四种编程语言的综合性 3200 亿 token 数据集进行训练的多语言大语言模型,模型参数量从 1.26 亿到 400 亿不等。
  • 《北欧语料集》数据集成功构建,严格遵守 GDPR 和版权法规,采用多阶段过滤与去重处理流程。
  • 该模型系列在北欧语言上实现了出色的零样本与少样本性能,经由基准评估与真实世界部署双重验证。
  • Klara 聊天机器人在公共艺术展览中的部署吸引了超过 7000 次用户交互,展现出优异的生成质量与公众参与度。
  • 受限预发布策略实现了对北欧 NLP 研究人员的负责任访问,同时保持合规性,未来计划实现全面开放发布。
  • 国家 HPC 基础设施(Berzelius)成功支持了 400 亿参数模型的训练,证明了在国家研究生态系统中实现大规模大语言模型训练的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。