[논문 리뷰] Skill-it! A Data-Driven Skills Framework for Understanding and Training Language Models
이 논문은 언어 모델(LM) 훈련을 상호의존적인 기술들의 시퀀스로 모델링하는 데이터 기반 프레임워크인 Skill-it를 제안한다. 이는 기술 그래프를 통해 형식화되어 효율적인 데이터 샘플링을 안내한다. 계속적인 사전 훈련과 피지테이닝에서 기술 순서를 활용함으로써, Skill-it는 LEGO에서 랜덤 샘플링 대비 36.5점 높은 정확도를 달성했으며, Natural Instructions에서 검증 손실을 13.6% 감소시켜 정적 및 기준 샘플링 방법을 능가한다.
The quality of training data impacts the performance of pre-trained large language models (LMs). Given a fixed budget of tokens, we study how to best select data that leads to good downstream model performance across tasks. We develop a new framework based on a simple hypothesis: just as humans acquire interdependent skills in a deliberate order, language models also follow a natural order when learning a set of skills from their training data. If such an order exists, it can be utilized for improved understanding of LMs and for data-efficient training. Using this intuition, our framework formalizes the notion of a skill and of an ordered set of skills in terms of the associated data. First, using both synthetic and real data, we demonstrate that these ordered skill sets exist, and that their existence enables more advanced skills to be learned with less data when we train on their prerequisite skills. Second, using our proposed framework, we introduce an online data sampling algorithm, Skill-It, over mixtures of skills for both continual pre-training and fine-tuning regimes, where the objective is to efficiently learn multiple skills in the former and an individual skill in the latter. On the LEGO synthetic in the continual pre-training setting, Skill-It obtains 36.5 points higher accuracy than random sampling. On the Natural Instructions dataset in the fine-tuning setting, Skill-It reduces the validation loss on the target skill by 13.6% versus training on data associated with the target skill itself. We apply our skills framework on the recent RedPajama dataset to continually pre-train a 3B-parameter LM, achieving higher accuracy on the LM Evaluation Harness with 1B tokens than the baseline approach of sampling uniformly over data sources with 3B tokens.
연구 동기 및 목표
- 데이터에서 유도된 상호의존적인 기술로 언어 모델 능력을 형식화하는 프레임워크를 개발하는 것.
- 훈련 데이터 내에서 자연스러운 기술 학습 순서가 존재하는지, 그리고 이를 데이터 효율적 훈련에 활용할 수 있는지 조사하는 것.
- 기본 기술 의존성에 기반해 학습을 가속화하는 동적이고 온라인 데이터 샘플링 알고리즘을 설계하는 것.
- 기본 기반 샘플링 전략과 비교해 기술 기반 순서가 모델 성능을 향상시키는지 검증하는 것.
- RedPajama 및 Natural Instructions를 포함한 합성 및 실세계 데이터셋에서 프레임워크의 효과성을 입증하는 것.
제안 방법
- 데이터 슬라이스에서 학습 가능한 행동 단위로 기술을 정의하고, 간선이 사전 요구 조건 의존성을 나타내는 방향 그래프를 통해 순서가 지정된 기술 집합을 형식화한다.
- 데이터 클러스터링과 임베딩 분석을 사용해 기술 관계를 식별하고, 합성 및 실세계 데이터셋에서 검증된 기술 그래프를 구축한다.
- 기본 기술 검증 손실과 그래프 구조에 기반해 샘플링 가중치를 동적으로 조정하는 온라인 데이터 선택 알고리즘인 Skill-it를 설계한다.
- 학습률 스케줄링과 함께 곱셈 가중치 업데이트를 사용해 더 어려운 기술을 우선순위로 삼으면서도 사전 요구 조건 의존성을 존중한다.
- 기본 기술 그래프를 계속적인 사전 훈련 및 피지테이닝 환경에 통합하여 데이터 믹스 선택을 안내한다.
- 다양한 벤치마크에서 Skill-it를 랜덤 샘플링, 그래프 없음, 정적 샘플링(T=1)과 비교한 추론 분석을 통해 프레임워크를 평가한다.
실험 결과
연구 질문
- RQ1실제 및 합성 언어 모델 훈련 데이터에 상호의존적인 기술 집합이 존재하는가, 그리고 데이터 기반 클러스터링과 임베딩를 통해 형식화할 수 있는가?
- RQ2사전 요구 조건 기술을 먼저 훈련하면 더 복잡한 기술을 학습하는 데 필요한 데이터가 줄어들고, 이로 인해 측정 가능한 성능 향상이 이루어지는가?
- RQ3Skill-it의 동적이고 그래프 인식 샘플링 전략은 수렴 속도와 최종 성능 측면에서 랜덤 샘플링 및 정적 샘플링과 비교해 어떻게 다른가?
- RQ4기본 기술 그래프 구조와 온라인 샘플링 가중치 적응이 계속적인 사전 훈련 및 피지테이닝에서 학습 효율성을 얼마나 향상시키는가?
- RQ5이 프레임워크는 RedPajama 및 Natural Instructions와 같은 실세계 데이터셋으로 일반화될 수 있으며, 동일한 토큰 예산에서 균일 샘플링보다 우수한 성능을 보이는가?
주요 결과
- 합성된 LEGO 지속적 사전 훈련 작업에서 Skill-it는 랜덤 샘플링 대비 36.5점 높은 정확도를 달성하여 기술 순서화의 뚜렷한 성능 향상을 입증했다.
- Natural Instructions 데이터셋에서 Skill-it는 목표 기술과 관련된 데이터만으로 훈련하는 것과 비교해 검증 손실을 13.6% 감소시켰다.
- LEGO, 덧셈, Natural Instructions를 포함한 모든 평가된 데이터셋에서 Skill-it는 정적 샘플링(T=1) 및 그래프 없음 기반 모델보다 뛰어난 성능을 보였으며, 이는 동적 적응성과 그래프 인식 가중치의 결과였다.
- Natural Instructions에서의 도메인 외 평가에서 Skill-it는 12개 기술 중 7개에서 가장 낮은 검증 손실을 기록했고, 평균 손실 2.540을 기록하여 정적 방법의 2.541–2.551보다 낮았다.
- 추론 분석을 통해 기술 그래프와 온라인 동적 요소가 모두 필수적임을 확인했다: 둘 중 하나를 제거하면 특히 더 어려운 기술에 훈련 토큰을 비효율적으로 할당하게 된다.
- 이 프레임워크는 3B 파라미터 언어 모델이 RedPajama에서 10억 토큰으로 지속적 사전 훈련을 수행할 때 LM Evaluation Harness에서 더 높은 정확도를 달성했으며, 30억 토큰으로 균일 샘플링을 수행한 경우보다 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.