Skip to main content
QUICK REVIEW

[논문 리뷰] SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling

Dahyun Kim, Chanjun Park|arXiv (Cornell University)|2023. 12. 23.
Natural Language Processing Techniques인용 수 7
한 줄 요약

SOLAR 10.7B는 깊이 증강(Deepening Up-Scaling, DUS) 기법을 간단하면서도 효과적으로 도입하여 기존 32층의 Llama 2 기반 모델을 깊이 스케일링과 지속적 미세조정을 통해 10.7B 매개변수로 확장함으로써 자연어 처리 벤치마크에서 최신 기준 성능을 달성하고, 지시 따르기 작업에서 Mixtral-8x7B-Instruct를 능가함. 이 모델는 Apache 2.0 라이선스 하에 공개되어 광범위한 접근성을 확보함.

ABSTRACT

We introduce SOLAR 10.7B, a large language model (LLM) with 10.7 billion parameters, demonstrating superior performance in various natural language processing (NLP) tasks. Inspired by recent efforts to efficiently up-scale LLMs, we present a method for scaling LLMs called depth up-scaling (DUS), which encompasses depthwise scaling and continued pretraining. In contrast to other LLM up-scaling methods that use mixture-of-experts, DUS does not require complex changes to train and inference efficiently. We show experimentally that DUS is simple yet effective in scaling up high-performance LLMs from small ones. Building on the DUS model, we additionally present SOLAR 10.7B-Instruct, a variant fine-tuned for instruction-following capabilities, surpassing Mixtral-8x7B-Instruct. SOLAR 10.7B is publicly available under the Apache 2.0 license, promoting broad access and application in the LLM field.

연구 동기 및 목표

  • 복잡한 아키텍처 변경 없이도 단순하고 효율적이며 광범위하게 호환 가능한 대규모 언어 모델 스케일링 방법을 개발하는 것.
  • 소규모 모델에서 고성능 LLM을 효율적인 계산 비용과 사용 용이성 유지를 바탕으로 스케일링하는 과제를 해결하는 것.
  • 지시 따르기 능력을 향상시키기 위해 미세조정을 통해, 더 큰 MoE 기반 모델인 Mixtral-8x7B-Instruct를 능가하는 모델를 만드는 것.
  • Apache 2.0 라이선스 하에 SOLAR 10.7B 및 지시 미세조정 버전을 공개함으로써 개방형 연구를 촉진하는 것.

제안 방법

  • 깊이 증강(Deepening Up-Scaling, DUS)은 기본 모델을 복제하고, 한 쪽에서는 끝에서 m개의 레이어를 제거하고, 다른 쪽에서는 앞에서 m개의 레이어를 제거한 후 두 모델을 병합하여 더 깊은 모델을 구성하는 방식이다.
  • 이 방법은 Tan과 Le(2019)의 깊이 기반 스케일링 아이디어를 변형하여 트랜스포머 아키텍처에 적용하며, 믹스처 오브 응용자(MoE)나 동적 라우팅을 도입하지 않는다.
  • 확장된 모델는 스케일링 이후 성능 복원 및 향상을 위해 다양한 데이터셋의 지속적 미세조정을 수행한다.
  • 지시 따르기 데이터셋인 Alpaca-GPT4, OpenOrca, Synth. Math-Instruct를 활용해 지시 미세조정 버전인 SOLAR 10.7B-Instruct를 훈련시킨다.
  • 모델 머지 기법으로 평균 가중치와 SLERP를 평가하였으며, 성능 안정성에 기반해 'Merge v1'을 선택하였다.
  • 이 접근법은 HuggingFace 및 표준 LLM 프레임워크와 완전히 호환되며, 훈련 또는 추론 파이프라인에 대한 수정이 필요 없다.
Figure 1: Depth up-scaling for the case with $n=32,s=48,$ and $m=8$ . Depth up-scaling is achieved through a dual-stage process of depthwise scaling followed by continued pretraining.
Figure 1: Depth up-scaling for the case with $n=32,s=48,$ and $m=8$ . Depth up-scaling is achieved through a dual-stage process of depthwise scaling followed by continued pretraining.

실험 결과

연구 질문

  • RQ1복잡한 아키텍처 변경 없이도 단순한 깊이 기반 스케일링 전략이 소규모 LLM을 고성능 대규모 모델로 효과적으로 확장할 수 있는가?
  • RQ2깊이 스케일링 이후 지속적 미세조정이 단순 스케일링 대비 모델 성능 향상에 뚜렷한 기여를 하는가?
  • RQ3깊이 증강된 모델이 지시 따르기 벤치마크에서 더 큰, 더 복잡한 모델인 Mixtral-8x7B-Instruct를 능가할 수 있는가?
  • RQ4최종 집계 단계에서 다양한 모델 머지 전략에 대해 결과가 얼마나 강인한가?
  • RQ5DUS 방법이 표준 LLM 프레임워크와의 호환성과 성능 유지에 얼마나 효과적인가?

주요 결과

  • SOLAR 10.7B는 다양한 작업에서 Llama 2 및 Mistral 7B를 능가하는 자연어 처리 벤치마크에서 최신 기준 성능을 달성함.
  • SOLAR 10.7B-Instruct는 평가된 모든 지시 따르기 메트릭에서 Mixtral-8x7B-Instruct를 능가하여, 적절히 스케일링된 소규모 모델이 더 큰 MoE 기반 모델을 능가할 수 있음을 입증함.
  • 깊이 증강(DUS) 기법은 훈련 및 추론 프레임워크에 최소한의 변경으로 LLM을 효율적으로 확장할 수 있게 하며, HuggingFace와의 호환성을 유지함.
  • 평균 가중치와 SLERP를 통한 모델 머지에서 성능 차이가 미미하여, 상호보완적인 강점을 지닌 후보 모델 간의 머지 전략에 대해 높은 강인성을 보임.
  • 모델는 Apache 2.0 라이선스 하에 공개되어 광범위한 커뮤니티 접근성을 보장하고, LLM 연구 분야의 개방형 혁신을 촉진함.
  • 평가 과정에서 낮은 데이터 오염 수준을 보이며, 강력한 데이터 정제 및 처리 프로토콜을 반영함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.