[논문 리뷰] Preserving Diversity in Supervised Fine-Tuning of Large Language Models
이 논문은 대규모 언어 모델을 위한 새로운 지도적 미세조정 방법인 GEM(Generative Entropy-regularized Matching)을 제안한다. 이 방법은 교차 엔트로피 손실 대신 반전 쿨백-라이블러 발산 최소화와 엔트로피 정규화를 조합하여 사용한다. GEM은 과적합을 줄이고 생성 다양성을 크게 향상시켜, best-of-n 샘플링을 사용할 때 코드 생성 및 수학 추론 벤치마크에서 최대 10포인트의 성능 향상을 이룬다. 이는 Llama-3-8B 모델에서 표준 교차 엔트로피 및 가중치 감쇠 기반 베이스라인을 능가한다.
Large Language Models (LLMs) typically rely on Supervised Fine-Tuning (SFT) to specialize in downstream tasks, with the Cross Entropy (CE) loss being the de facto choice. However, CE maximizes the likelihood of observed data without accounting for alternative possibilities. As such, CE usually leads to reduced diversity in the model's outputs, which hinders further development that requires sampling to explore better responses. To address this limitation, this paper introduces a new game-theoretic formulation for SFT. In this framework, an auxiliary variable is introduced to regulate the learning process. We prove that the proposed game-theoretic approach connects to the problem of reverse KL minimization with entropy regularization. This regularization prevents over-memorization of training data and promotes output diversity. To implement this framework, we develop GEM, a new training algorithm that is computationally efficient as CE by leveraging some unique properties of LLMs. Empirical studies of pre-trained models from 3B to 70B parameters show that GEM achieves comparable downstream performance to CE while significantly enhancing output diversity. This increased diversity translates to performance gains in test-time compute scaling for chat and code generation tasks. Moreover, we observe that preserving output diversity has the added benefit of mitigating forgetting, as maintaining diverse outputs encourages models to retain pre-trained knowledge throughout the training process.
연구 동기 및 목표
- 대규모 언어 모델(LLM)의 지도적 미세조정(SFT)에서 일반적으로 발생하는 교차 엔트로피(CE) 손실의 과도한 업데이트로 인한 과적합과 생성 다양성의 제한을 해결하기 위해.
- 데이터 무결성을 유지하면서 더 평탄하고 다양한 출력 분포를 장려하는 교차 엔트로피 손실의 원리적인 대안을 개발하기 위해.
- 특히 best-of-n 샘플링과 같은 고급 디코딩 전략에 의존하는 작업에서 일반화 능력과 성능을 향상시키기 위해 모델의 다양성을 향상시키기 위해.
- 표준 SFT 훈련에 비해 실용적이고 효과적인 엔트로피 정규화된 반전 KL 발산 최소화의 타당성을 입증하기 위해.
- 일반적이고 도메인 특화된 지시 미세조정에 모두 적용 가능한 확장성 있고 효율적인 방법을 제공하기 위해.
제안 방법
- 반전 쿨백-라이블러(KL) 발산을 데이터 분포와 모델의 생성 분포 간에 최소화하는 기반으로 삼고, 과도기억을 방지하기 위해 엔트로피 정규화를 추가한 새로운 훈련 목표인 GEM(Generative Entropy-regularized Matching)을 제안한다.
- 적절한 최적화 기법을 사용하여 적대적 훈련을 피함으로써 계산적으로 효율적이며 표준 SFT 프레임워크와 호환된다.
- 데이터 가능성과 출력 다양성 간의 균형을 맞추기 위해 엔트로피를 최대화하면서도 여전히 지도 데이터에 적합하도록 하는 손실 함수를 도입한다.
- 미세조정 중 엔트로피 정규화된 반전 KL 목표를 미분 가능하게 최적화하기 위해 재매개변수화 기법을 활용한다.
- 일반적(UltraFeedback) 및 도메인 특화(MetaMathQA, Magicoder-OSS-Instruct) 데이터셋을 사용하여 Llama-3-8B에 적용하여 일반화 능력과 다양성 평가.
- 다양성 향상을 평가하기 위해 best-of-n 샘플링과 다수결 투표를 사용하고, 코드 및 수학 벤치마크에서 pass@100 및 정확도 지표를 측정한다.

실험 결과
연구 질문
- RQ1교차 엔트로피 손실을 엔트로피 정규화된 반전 KL 발산 최소화로 대체할 경우, 지도적 미세조정에서 과적합이 감소하는가?
- RQ2제안된 GEM 방법은 도메인 특화 데이터 없이도 생성 다양성을 향상시키는가?
- RQ3GEM은 수학 추론 및 코드 생성과 같이 다양한 출력이 유리한 후행 작업에서 성능을 얼마나 향상시키는가?
- RQ4다양한 데이터셋에서 일반화 및 강건성 측면에서 GEM은 표준 CE 손실 및 가중치 감쇠 정규화와 비교해 어떻게 성능을 내는가?
- RQ5엔트로피 정규화는 모드 붕괴를 완화하고 best-of-n 샘플링과 같은 고급 디코딩 전략 하에서 성능 향상에 기여하는가?
주요 결과
- 지시 미세조정을 위한 UltraFeedback 데이터셋에서 GEM는 퍼플렉서티를 감소시키고 IFEval 성능을 향상시켜 CE 손실 대비 과적합이 적음을 시사한다.
- GSM8K 및 MATH에서 수학 추론 작업을 수행한 결과, GEM-LS는 각각 BON@32에서 CE 대비 2.6점 및 1.6점 향상되어 다양성과 일반화 능력 향상을 입증했다.
- 코드 생성 벤치마크에서 GEM-LS는 HumanEval에서 Pass@100 기준으로 CE 대비 9.7점(14.7% 상대적 향상) 향상되었고, MBPP에서는 8.0점(11.1% 상대적 향상) 향상되었다.
- 더 어려운 MATH 벤치마크에서는 탐욕적 디코딩에서 1.9점(8.0% 상대적 향상), 다수결 투표에서 1.7점(5.8% 상대적 향상) 향상되어 어려운 작업에 대한 강건성을 보였다.
- 가중치 감쇠 정규화는 일관된 향상이 없었고, GEM는 모든 벤치마크 및 설정에서 CE를 일관되게 능가하여 과적합 감소 및 다양성 증가 효과를 확인했다.
- 결과는 GEM의 엔트로피 정규화가 과적합을 효과적으로 완화하고 best-of-n 샘플링과 같은 테스트 시 계산 및 자기 향상 파이프라인에서 더 나은 성능을 내는 데 기여함을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.