[논문 리뷰] Gemma 2: Improving Open Language Models at a Practical Size
Gemma 2는 2B, 9B, 27B의 오픈 모델을 지식 증류와 Transformer 수정으로 학습시켰으며, 각 크기에서 최첨단 성능을 달성하고 더 큰 모델에 비해 경쟁력 있는 결과를 보여준다.
In this work, we introduce Gemma 2, a new addition to the Gemma family of lightweight, state-of-the-art open models, ranging in scale from 2 billion to 27 billion parameters. In this new version, we apply several known technical modifications to the Transformer architecture, such as interleaving local-global attentions (Beltagy et al., 2020a) and group-query attention (Ainslie et al., 2023). We also train the 2B and 9B models with knowledge distillation (Hinton et al., 2015) instead of next token prediction. The resulting models deliver the best performance for their size, and even offer competitive alternatives to models that are 2-3 times bigger. We release all our models to the community.
연구 동기 및 목표
- 학습 길이를 단순히 늘리지 않으면서 소형에서 중형 규모의 오픈 언어 모델 성능을 향상시키는 것.
- Gemma 2에서 지식 증류와 아키텍처 수정(로컬-글로벌 어텐션, GQA)의 효과를 평가한다.
- 실용적 용도의 LLM에 대한 사전-훈련(프리트레이닝) 및 사후훈련(포스트 트레이닝) 전략, 안전성, 배포 고려사항을 평가한다.
- 대규모 오픈 모델 및 베이스라인과의 비교를 자동화된 벤치마크와 인간 평가에서 Gemma 2 모델에 대해 수행한다.
제안 방법
- 로컬 슬라이딩 윈도우와 글로벌 어텐션 계층이 교차되도록 디코더-전용 Transformer 아키텍처를 채택한다(로컬 4096, 글로벌 8192).
- 추론 속도 향상을 위해 num_groups=2인 Grouped-Query Attention(GQA)을 적용한다.
- 안정성을 위해 RMSNorm을, 효율을 위해 GeGLU 비선형성을 사용한다.
- 큰 교사 모델에서의 지식 증류로 2B/9B 모델을 학습시키고; 27B는 처음부터 학습한다.
- 256k SentencePiece 어휘를 사용하여 13T 토큰(27B), 8T(9B), 2T(2B)까지 사전학습; 안전하지 않은 출력 감소를 위한 데이터 필터링을 수행한다.
- 감독 미세조정(SFT)과 사람 피드백 기반 강화학습(RLHF)을 통해 포스트-트레이닝; 여러 하이퍼파라미터의 모델을 평균 내어 최종 IT 모델을 형성한다.
- 안전성, 암기, 다중 턴 대화 능력을 표준 벤치마크와 함께 평가한다.

실험 결과
연구 질문
- RQ1매우 큰 토큰 수로 학습될 때 지식 증류가 소형에서 중형 규모의 오픈 LLM의 성능을 향상시키는가?
- RQ2실용적 크기에서 로컬-글로벌 교차 및 GQA 같은 아키텍처 튜닝이 효율성과 다운스트림 성능에 미치는 영향은 무엇인가?
- RQ3안전성 및 정렬 측면을 포함한 자동 벤치마크와 인간 평가에서 Gemma 2 모델이 더 큰 오픈 모델과 어떻게 비교되는가?
- RQ4오픈 Gemma 2 모델의 공개가 안전성, 암기 및 배포에 어떤 함의를 갖는가?
- RQ5사후훈련(SFT/RLHF)과 모델 융합이 실제로 지시 이행 및 사용자 만족도에 어떤 영향을 미치는가?
주요 결과
- 더 큰 모델의 증류가 소형 모델의 성능을 크게 향상시키며; 예를 들어 2B 및 9B 모델은 동일한 토큰 수로 학습된 이전 버전에 비해 큰 개선을 보이고, 9B 모델에서 일부 벤치마크에서 약 10% 정도의 향상을 보인다.
- 27B Gemma 2는 크기가 두 배 이상인 모델에 비해 경쟁력 있는 성능을 달성하며, 일부 평가에서 LLaMA-3 70B와도 데이터가 적게 학습했음에도 경쟁적이다.
- 포스트 트레이닝에서 Gemma 2 IT 모델은 인간 평가에서 많은 오픈 모델을 능가하고 LMSYS Chatbot Arena에서 높은 Elo 점수를 얻어 더 큰 규모의 여러 폐쇄 및 오픈 경쟁자들을 능가한다(예: Gemma 27B Elo 1218 vs LLaMA-3 70B Elo 1206).
- 암기 비율이 현저히 낮으며, 직역 암기(verbatim memorization) <0.1%이고 데이터 소스 전반에서 근사적 암기가 낮다.
- Gemma 2는 외부 및 내부 평가에서 안전성 지표가 개선되었고, IT 모델은 인간 평가에서 지시 이행 및 안전성 측면에서 더 강한 성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.