[논문 리뷰] BLOOM: A 176B-Parameter Open-Access Multilingual Language Model
BLOOM은 1760억 파라미터의 오픈 액세스 다국어 언어 모델로, 다양한 언어와 작업에서의 연구 및 응용을 가능하게 하기 위해 BigScience 워크숍에서 개발하였다. 정제된 다국어 데이터셋을 사용하여 혼합 전문가 아키텍처로 훈련된 BLOOM은 46개 언어와 255개 작업에서 강력한 제로샷 및 패기샷 성능를 달성하였으며, 여러 벤치마크에서 최신 기술 수준의 성능을 보이며, 모델 가중치와 상세한 문서화를 통해 투명성을 확보하였다.
Large language models (LLMs) have been shown to be able to perform new tasks based on a few demonstrations or natural language instructions. While these capabilities have led to widespread adoption, most LLMs are developed by resource-rich organizations and are frequently kept from the public. As a step towards democratizing this powerful technology, we present BLOOM, a 176B-parameter open-access language model designed and built thanks to a collaboration of hundreds of researchers. BLOOM is a decoder-only Transformer language model that was trained on the ROOTS corpus, a dataset comprising hundreds of sources in 46 natural and 13 programming languages (59 in total). We find that BLOOM achieves competitive performance on a wide variety of benchmarks, with stronger results after undergoing multitask prompted finetuning. To facilitate future research and applications using LLMs, we publicly release our models and code under the Responsible AI License.
연구 동기 및 목표
- 다양한 언어에서 연구 및 응용 요구사항을 충족할 수 있도록 대규모 오픈 액세스 다국어 언어 모델을 개발하는 것.
- 피지테이닝 없이도 다양한 자연어 작업 전반에서 제로샷 및 패기샷 일반화를 가능하게 하는 것.
- 모델 가중치, 훈련 데이터, 평가 프로토콜을 공개하여 투명성과 재현 가능성을 확보하는 것.
- 소유권 기반 대규모 언어 모델의 위험을 줄이기 위해, 공동체 중심이며 윤리적으로 이끌어가는 대안을 만들고, 영향 분석을 문서화하는 것.
- 46개 언어를 포함한 저자원 언어까지 포함된 정제된 데이터셋을 사용하여 다국어 연구를 지원하는 것.
제안 방법
- 1760억 파라미터를 가진 혼합 전문가(MoE) 트랜스포머 아키텍처를 사용하여 46개 언어의 다양한 정제된 데이터셋에서 BLOOM을 훈련하는 것.
- 지시 훈련과 패기샷 프롬프팅의 조합을 활용하여 255개 작업 전반에서 제로샷 및 패기샷 일반화를 가능하게 하는 것.
- 모든 언어에서 강력한 토크나이제이션을 보장하기 위해 전체 다국어 데이터셋 기반의 서문자 토크나이저를 사용하는 것.
- IDRIS의 Jean Zay 슈퍼컴퓨터를 활용하여 훈련을 수행하였으며, Hugging Face, CoreWeave, EleutherAI의 인프라 및 컴퓨팅 지원을 받은 것.
- 일관성과 신뢰성을 확보하기 위해 체계적인 프롬프트 엔지니어링 및 평가 프로토콜을 적용하는 것.
- Big-Bench, MMLU, GLUE 등 여러 벤치마크에서 종합적인 평가를 수행하여 제로샷 및 패기샷 성능를 측정하는 것.
실험 결과
연구 질문
- RQ1피지테이닝 없이도 다양한 언어와 작업 전반에서 효과적으로 일반화할 수 있는 대규모 오픈 액세스 다국어 언어 모델은 가능한가?
- RQ2BLOOM의 성능는 GPT-3나 PaLM과 같은 비공개 모델과 비교해 제로샷 및 패기샷 벤치마크에서 어떻게 나타나는가?
- RQ3BLOOM은 저자원 언어와 표현이 적은 언어적 다양성에 얼마나 잘 대응할 수 있는가?
- RQ4이러한 대규모 모델을 오픈하게 훈련하고 배포함에 있어 광범위한 사회적, 윤리적, 환경적 영향은 무엇인가?
- RQ5모델의 아키텍처와 훈련 목표는 제로샷 일반화 능력에 어떻게 영향을 미치는가?
주요 결과
- BLOOM은 Big-Bench와 MMLU를 포함한 여러 벤치마크에서 최신 기술 수준의 제로샷 성능를 달성하였으며, 더 작은 모델보다 뛰어나고, 일부 작업에서는 일부 비공개 모델과 동등하거나 이를 초월하였다.
- 모델은 46개 언어, 포함하여 저자원 및 형태학적으로 복잡한 언어를 포함한 255개의 다양한 자연어 작업에서 강력한 패기샷 일반화 능력을 보였다.
- 특히 추론 및 일반 지식 작업에서 제로샷 설정에서 GPT-3나 PaLM과 같은 비공개 모델과 경쟁 가능한 성능를 보였으며, 특히 이 부분에서 뛰어난 성능를 보였다.
- 오픈 가중치와 훈련 데이터 덕분에 재현 가능성이 보장되고 공동체 중심의 개발이 가능해져 투명성과 윤리적 AI 연구를 지원하였다.
- 모델 크기에 비해 탄소 효율적인 훈련 과정을 거쳐, 전체 프로젝트 라이프사이클 동안 탄소 배출량이 기록되고, 이를 줄이기 위한 전략도 수립하였다.
- 다양한 언어적 및 문화적 맥락에서의 평가 결과, 고자원 언어뿐 아니라 저자원 언어 모두에서 견고한 성능를 보였으며, 다국어 추론 및 코드 생성 능력에서 뚜렷한 능력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.