Skip to main content
QUICK REVIEW

[论文解读] BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model

Christopher Akiki, Giada Pistilli|arXiv (Cornell University)|Dec 9, 2022
Ethics and Social Impacts of AI被引用 8
一句话总结

本文介绍了 BigScience 项目,这是一个以价值观为导向、参与式开展的倡议,成功开发了 BLOOM——一个经过 1.5 年跨学科合作、基于 ROOTS 数据集训练而成的 1.6TB 多语言语言模型。该项目强调在学科和地理上实现广泛而多样的参与,证明了大规模人工智能研究可以实现伦理引导与社会建构,其成果不仅限于技术产品,还对研究文化与治理模式产生深远影响。

ABSTRACT

The BigScience Workshop was a value-driven initiative that spanned one and half years of interdisciplinary research and culminated in the creation of ROOTS, a 1.6TB multilingual dataset that was used to train BLOOM, one of the largest multilingual language models to date. In addition to the technical outcomes and artifacts, the workshop fostered multidisciplinary collaborations around large models, datasets, and their analysis. This in turn led to a wide range of research publications spanning topics from ethics to law, data governance, modeling choices and distributed training. This paper focuses on the collaborative research aspects of BigScience and takes a step back to look at the challenges of large-scale participatory research, with respect to participant diversity and the tasks required to successfully carry out such a project. Our main goal is to share the lessons we learned from this experience, what we could have done better and what we did well. We show how the impact of such a social approach to scientific research goes well beyond the technical artifacts that were the basis of its inception.

研究动机与目标

  • 探索大规模、参与式研究在训练多语言语言模型方面的可行性与影响。
  • 解决人工智能开发过程中数据偏差、代表性不足与权力失衡等伦理问题。
  • 在人工智能研究中促进跨学科、跨地理区域的跨领域协作。
  • 创建一种透明、包容且以价值观为导向的开源大语言模型开发替代方案,替代专有大语言模型的开发模式。

提出的方法

  • 组织了一场为期 1.5 年的跨学科工作坊,汇聚来自 38 个国家的 308 名贡献者,共同设计并构建 BLOOM 与 ROOTS 数据集。
  • 采用以价值观为导向的伦理章程,指导数据收集、模型训练与成果传播的全过程。
  • 采用自下而上的共识治理模式,结构简单,以促进广泛参与。
  • 借助 Hugging Face 的基础设施与支持,包括全职技术项目管理人员,以维持项目推进与协调。
  • 在参与者遴选中优先考虑目标性多样性,纳入人工智能研究中代表性不足的声音。
  • 使用开放协作工具与透明工作流程,确保所有阶段的可追溯性与包容性。

实验结果

研究问题

  • RQ1如何在确保学科与地理多样性广泛参与的前提下,开展大规模人工智能研究?
  • RQ2在协调一个去中心化、以价值观为导向的大语言模型研究项目时,面临哪些社会与组织挑战?
  • RQ3以参与式与伦理为基础的研究如何影响大语言模型的质量、代表性与社会影响?
  • RQ4何种结构与治理模式最能支持可持续、透明且公平的大规模人工智能开发?

主要发现

  • BigScience 工作坊成功通过全球分布、跨学科协作(308 名来自 38 个国家的贡献者)训练出 BLOOM——一个 1.6TB 的多语言语言模型。
  • BLOOM 的基础数据集 ROOTS 是通过透明、参与式流程创建的,特别强调数据多样性与伦理数据来源。
  • 该项目证明,以价值观为导向的包容性研究实践,可以在不依赖专有或集中化模型的前提下,实现高影响力的技术成果。
  • 参与者的主要动机是内在的——如获得曝光度、共同作者资格、建立人脉以及与项目价值观的契合,而非经济报酬。
  • 缺乏正式法律实体与资金结构,限制了机构参与与报酬发放,凸显了非正式大规模研究协作中的结构性挑战。
  • 项目成功高度依赖 Hugging Face 的支持,特别是全职技术项目管理人员的投入,凸显了此类项目中持续协调角色的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。