[논문 리뷰] XGen-7B Technical Report
XGen-7B는 최대 1.5조 토큰으로 훈련된 7B 파라미터의 대규모 언어 모델로, 8K 컨텍스트 길이를 지원하며, 두 단계 훈련 과정(2K → 4K → 8K)과 자연어 및 코드를 포함한 다양한 데이터 혼합물을 사용한다. 표준 벤치마크에서 최신 기술 성능을 달성하고, 대화 요약 및 코드 생성과 같은 장문 컨텍스트 작업에서 2K 시퀀스 오픈소스 모델보다 뚜렷이 뛰어난 성능을 보인다.
Large Language Models (LLMs) have become ubiquitous across various domains, transforming the way we interact with information and conduct research. However, most high-performing LLMs remain confined behind proprietary walls, hindering scientific progress. Most open-source LLMs, on the other hand, are limited in their ability to support longer sequence lengths, which is a key requirement for many tasks that require inference over an input context. To address this, we have trained XGen, a series of 7B parameter models on up to 8K sequence length for up to 1.5T tokens. We have also finetuned the XGen models on public-domain instructional data, creating their instruction-tuned counterparts (XGen-Inst). We open-source our models for both research advancements and commercial applications. Our evaluation on standard benchmarks shows that XGen models achieve comparable or better results when compared with state-of-the-art open-source LLMs. Our targeted evaluation on long sequence modeling tasks shows the benefits of our 8K-sequence models over 2K-sequence open-source LLMs.
연구 동기 및 목표
- 2K 컨텍스트 길이로 제한된 오픈소스 LLM의 한계를 해결함으로써, 코드 생성 및 문서 요약과 같은 장문 컨텍스트 작업에서의 성능 저하를 방지한다.
- 단계적 사전 훈련을 통해 장기 컨텍스트 길이를 지원하면서도 강력한 성능을 유지하는 확장성 있고 효율적인 7B 파라미터 모델을 개발한다.
- 기본 및 지시 테이닝 버전을 오픈소스화하여 과학적 및 상업적 활용을 넓히고자 한다.
- 다양한 공공 영역 지시 데이터셋을 기반으로 한 지도적 미세조정을 통해 지시 준수 능력을 향상시켜, 제로샷 및 피처샷 일반화 능력을 향상시킨다.
제안 방법
- 두 단계 사전 훈련 전략을 적용: 먼저 자연어 및 코드 데이터를 포함한 1.2조 토큰으로 2K 컨텍스트 길이에서 사전 훈련한 후, 4K로 이어지며 추가로 3000억 토큰을 사용해 8K 컨텍스트 길이로 계속 훈련한다.
- 자연어 데이터는 다양한 공공 코퍼스에서, 코드 전용 사전 훈련을 위해 RedPajama의 GitHub 코드와 BigCode Starcoder를 포함한 다양한 데이터 소스 혼합물을 활용하며, 유연한 라이센스를 적용한다.
- GPT-2를 기반으로 한 바이트 쌍 인코딩(BPE) 토크나이저를 사용하며, 코드 및 지시 테이닝을 위한 특수 토큰을 추가한다.
- XGen-7B-8K 기본 모델을 두 가지 공공 지시 데이터셋인 WizardLM-196K와 일반 지시 데이터(OAsst, Baize, Dolly2, ShareGPT, SCROLLS)에 대해 미세조정하여 XGen-7B-Inst 버전을 생성한다.
- TPU 풀을 활용한 혼합 정밀도 훈련 및 모델 병렬 처리를 통해 훈련 효율성을 최적화하였으며, 총 훈련 비용은 약 57MWh이며, 이산화탄소 배출량은 4.5톤 CO₂eq이다.
- 표준 LLM 평가 프로토콜을 사용하여 표준 및 장문 컨텍스트 벤치마크에서 퍼플렉서티, 정확도, ROUGE 점수를 측정한다.

실험 결과
연구 질문
- RQ12K → 8K로 점진적인 컨텍스트 길이 스케일링을 거친 1.5조 토큰으로 훈련된 7B 파라미터 모델이 표준 및 장문 컨텍스트 벤치마크에서 경쟁력 있는 성능을 달성할 수 있는가?
- RQ2XGen-7B의 8K 컨텍스트 길이가 대화 요약 및 코드 생성과 같은 장문 컨텍스트 작업에서 2K 시퀀스 오픈소스 모델과 비교해 어떤가?
- RQ3XGen-7B의 지시 테이닝 버전은 AlpacaEval 및 MTBench와 같은 지시 준수 벤치마크에서 유사 크기 또는 더 큰 모델보다 얼마나 뛰어나게 성능을 내는가?
- RQ4이러한 모델을 훈련하는 데 드는 환경적 비용은 얼마이며, 에너지 소비 및 이산화탄소 배출 측면에서 다른 LLM과 비교해 어떻게 되는가?
- RQ5XGen-7B와 같은 작은 효율적인 모델이 기초 및 지시 테이닝 설정에서 더 큰 전문 또는 오픈소스 모델의 성능을 따라하거나 초월할 수 있는가?
주요 결과
- XGen-7B-8K는 표준 벤치마크에서 최신 기술 오픈소스 LLM과 유사하거나 뛰어난 성능을 보이며, 코드 생성 작업에서 강력한 성능을 기록한다.
- AlpacaEval 벤치마크에서 XGen-7B-Inst (general)는 WizardLM-7B와 MPT-7B를 능가하며, 더 큰 모델인 Falcon-40B-instruct조차도 뛰어넘는 성능을 보였다.
- MTBench 벤치마크에서 XGen-7B-Inst (general)는 Mixture-of-Model (MoE) 지표에서 8.25점의 점수를 기록하여 Alpaca-13B와 Falcon-40B-instruct를 능가했다.
- 장문 대화 요약 작업(AMI, FD, TMS)에서 XGen-7B-Inst (general)는 AMI(5.5K 토큰)에서 ROUGE-1 점수 31.34를 기록하며 가장 높은 성능을 보였으며, 입력 자르기 없이도 MPT-7B-instruct 및 Alpaca-7B보다 뚜렷이 뛰어났다.
- 장문 컨텍스트 작업에서의 성능은 8K 컨텍스트 길이의 실질적 이점임을 입증하였으며, XGen-7B-8K는 2K 시퀀스 모델에 비해 장거리 의존성 모델링 능력에서 뚜렷한 우위를 보였다.
- XGen-7B의 탄소 발자국은 4.5톤 CO₂eq로 추정되며, 총 에너지 소비는 57MWh로, 다른 대규모 모델과 유사하지만 효율성과 오픈 액세스에 중점을 두었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.