[논문 리뷰] How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition
이 논문은 지도 미세조정(SFT) 데이터 구성이 대규모 언어 모델의 수학적 추론, 코드 생성 및 일반 지시 준거 능력에 미치는 영향을 조사한다. 이는 치명적인 잊음 현상을 완화하고 다양한 능력에서 뛰어난 성능을 달성할 수 있는 이중단계 혼합 미세조정(DMT) 전략을 제안한다. 특히 제한된 데이터 환경에서도 뛰어난 성능을 보이며, LLaMA 모델의 다양한 크기에서 DMT가 표준 SFT 전략을 능가하는 것을 실험적으로 입증한다.
Large language models (LLMs) with enormous pre-training tokens and parameters emerge diverse abilities, including math reasoning, code generation, and instruction following. These abilities are further enhanced by supervised fine-tuning (SFT). While the open-source community has explored ad-hoc SFT for enhancing individual capabilities, proprietary LLMs exhibit versatility across various skills. Therefore, understanding the facilitation of multiple abilities via SFT is paramount. In this study, we specifically focuses on the interplay of data composition between mathematical reasoning, code generation, and general human-aligning abilities during SFT. We propose four intriguing research questions to explore the association between model performance and various factors including data amount, composition ratio, model size and SFT strategies. Our experiments reveal that distinct capabilities scale differently and larger models generally show superior performance with same amount of data. Mathematical reasoning and code generation consistently improve with increasing data amount, whereas general abilities plateau after roughly a thousand samples. Moreover, we observe data composition appears to enhance various abilities under limited data conditions, yet can lead to performance conflicts when data is plentiful. Our findings also suggest the amount of composition data influences performance more than the composition ratio. In analysis of SFT strategies, we find that sequentially learning multiple skills risks catastrophic forgetting. Our proposed Dual-stage Mixed Fine-tuning (DMT) strategy offers a promising solution to learn multiple abilities with different scaling patterns.
연구 동기 및 목표
- 수학적 추론, 코드 생성, 일반 지시 준거 능력 간의 데이터 구성이 지도 미세조정 중 모델 성능에 미치는 영향를 이해하는 것.
- 다양한 데이터 양, 구성 비율, 모델 크기, SFT 전략에 따른 성능 스케일링 패턴을 조사하는 것.
- 다중 작업 SFT에서 발생하는 성능 갈등을 규명하고 그 원인 요소를 특정하는 것.
- 다양한 스케일링 행동을 보이는 다수의 능력을 학습하기 위해 다중 작업, 순차적, 혼합 순차적, DMT와 같은 SFT 전략을 평가하고 비교하는 것.
제안 방법
- 수학, 코드, 일반 데이터의 균형 잡힌 조합으로 사전 훈련한 후, 치명적인 잊음 현상을 줄이기 위해 우선순위가 부여된 하위집합으로 미세조정하는 이중단계 혼합 미세조정(DMT) 전략을 제안한다.
- k비율 샘플링 기법을 사용하여 데이터 구성 비율을 제어하며, 여기서 k는 혼합 훈련에서 특정 능력 데이터의 비율을 나타낸다.
- GSM8K(수학적 추론), HumanEval(코드 생성), MT-Bench(일반 일치성)의 세 가지 벤치마크에서 통제된 실험을 수행한다.
- 모델 크기의 영향을 평가하기 위해 7B, 13B, 33B 파라미터를 가진 LLaMA 모델을 사용한다.
- DMT 훈련 후 표현의 변화를 분석하기 위해 t-SNE 시각화를 수행하여 각 능력 간 특징 공간의 군집화를 비교한다.
- ShareGPT에서 코드 및 수학 데이터를 제거하여 일반 지시 데이터의 영향을 분리하여 영향을 분석하기 위해 분석 실험을 수행한다.
실험 결과
연구 질문
- RQ1수학적 추론, 코딩, 일반 능력은 SFT 데이터 양이 증가함에 따라 어떻게 스케일링되는가?
- RQ2수학, 코드, 일반 능력을 하나의 SFT 단계에서 결합할 경우 성능 갈등이 발생하는가?
- RQ3성능 갈등을 유발하는 주요 요인들 — 데이터 양, 구성 비율, 모델 크기 — 는 무엇인가?
- RQ4다양한 스케일링 행동을 보이는 다수의 능력을 학습하기 위해 다중 작업, 순차적, 혼합 순차적, DMT 전략 등 다양한 SFT 전략은 어떤 영향을 미치는가?
주요 결과
- 수학적 추론 능력과 코드 생성 능력은 SFT 데이터가 증가할수록 일관되게 스케일링되며, 256개의 샘플에서도 성능 향상을 보인다.
- 일반 지시 준거 능력은 약 1,000개의 샘플 이후에 포화 상태에 도달하며, 이는 추론이나 코딩 능력에서는 관찰되지 않는 포화점이다.
- 높은 데이터 가용성 하에서 성능 갈등이 발생하며, 한 능력에 최적화하면 다른 능력의 성능이 떨어지며, 특히 다중 작업 학습에서 두드러진다.
- 구성 데이터의 양이 구성 비율보다 더 큰 영향을 미친다. 균형 잡힌 비율보다 더 높은 절대 데이터 양이 성능 향상에 더 큰 기여를 한다.
- 순차적 훈련은 치명적인 잊음 현상을 유발하며, 비순차적 작업의 성능이 크게 하락한다(예: LLaMA-7B에서 수학 정확도가 49.10에서 31.39로 감소).
- 제안된 DMT 전략은 모든 벤치마크에서 최고 성능을 달성한다: LLaMA-7B에서 각각 41.92(GSM8K), 17.68(HumanEval), 6.08(MT-Bench)를 기록하며, 다중 작업 및 순차적 기준 모델을 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.