[논문 리뷰] Instruction Pre-Training: Language Models are Supervised Multitask Learners
이 논문은 원시 코퍼스에 200만 개의 합성 지시-응답 쌍을 추가하여 언어 모델의 사전 훈련을 향상시키는 Instruction Pre-Training를 소개한다. 이는 오픈소스 기반의 지시 생성기로 생성된 것이다. 이 방법은 Llama3-8B와 같은 모델이 계속적인 사전 훈련에서 Llama3-70B의 성능을 따라하거나 초월할 수 있도록 하며, 일반화 능력과 지시 훈련 성과를 향상시킨다.
Unsupervised multitask pre-training has been the critical method behind the recent success of language models (LMs). However, supervised multitask learning still holds significant promise, as scaling it in the post-training stage trends towards better generalization. In this paper, we explore supervised multitask pre-training by proposing Instruction Pre-Training, a framework that scalably augments massive raw corpora with instruction-response pairs to pre-train LMs. The instruction-response pairs are generated by an efficient instruction synthesizer built on open-source models. In our experiments, we synthesize 200M instruction-response pairs covering 40+ task categories to verify the effectiveness of Instruction Pre-Training. In pre-training from scratch, Instruction Pre-Training not only consistently enhances pre-trained base models but also benefits more from further instruction tuning. In continual pre-training, Instruction Pre-Training enables Llama3-8B to be comparable to or even outperform Llama3-70B. Our model, code, and data are available at https://github.com/microsoft/LMOps.
연구 동기 및 목표
- 언어 모델에서 비감독 사전 훈련의 확장 가능한 대안으로 감독 다중 작업 사전 훈련의 잠재력을 탐색하는 것.
- 원시 텍스트에서 고품질의 다양한 지시-응답 쌍을 생성하여 감독 다중 작업 학습의 스케일링 과제를 해결하는 것.
- 대규모 데이터 증강을 가능하게 하기 위해 오픈소스 모델 기반의 비용 효율적인 지시 생성기를 개발하는 것.
- 지시 사전 훈련의 효과성을 사전 훈련에서 처음부터 또는 도메인 특화 데이터에서의 계속적인 사전 훈련을 통해 평가하는 것.
- 지시 증강 사전 훈련이 다운스트림 일반화 및 지시 훈련 성능을 향상시킨다는 것을 입증하는 것.
제안 방법
- 사전 훈련 코퍼스에 사전 훈련된 지시 생성기를 통해 생성된 합성 지시-응답 쌍을 추가한다.
- 각 예시가 원시 텍스트와 그 텍스트를 바탕으로 한 다수의 지시-응답 쌍을 포함하는 다각도로 캐서된 데이터셋에서 지시 생성기를 훈련시킨다.
- 비용 효율성과 확장성을 확보하기 위해 7B 파라미터 오픈소스 언어 모델을 지시 생성기의 기반으로 사용한다.
- 훈련된 생성기를 대규모 원시 텍스트 코퍼스에 적용하여 40개 이상의 작업 카테고리에 걸쳐 2억 개의 지시-응답 쌍을 생성한다.
- 기본적인 인과적 언어 모델링 목표를 사용하여 증강된 코퍼스에서 언어 모델을 사전 훈련한다.
- 지시 증강 코퍼스를 사용하여 재무, 생물의학 등 도메인 특화 데이터에서 계속적인 사전 훈련을 적용하여 도메인 적응 능력을 향상시킨다.
실험 결과
연구 질문
- RQ1효과적으로 스케일링된 감독 다중 작업 사전 훈련이 언어 모델 성능에서 비감독 사전 훈련을 뛰어넘거나 동등하게 성과를 낼 수 있는가?
- RQ2오픈소스 모델 기반의 생성기가 사전 훈련 데이터 증강을 위해 고품질의 다양한 지시-응답 쌍을 얼마나 효과적으로 생성하는가?
- RQ3Instruction Pre-Training가 일반화 능력과 다운스트림 지시 훈련 성능을 얼마나 향상시키는가?
- RQ4지시 증강 사전 훈련을 통해 Llama3-8B와 같은 작은 모델이 재무 등 도메인 특화 환경에서 Llama3-70B와 유사한 성능을 달성할 수 있는가?
- RQ5지시 증강 사전 훈련의 성공에 기여하는 데이터 품질과 다양성의 핵심 요소는 무엇인가?
주요 결과
- 1000억 토큰에서 Instruction Pre-Training를 통해 사전 훈련한 5억 파라미터 모델이 3000억 토큰에서 사전 훈련한 10억 파라미터 모델과 유사한 성능을 보였다.
- Instruction Pre-Training로 사전 훈련된 모델들은 표준 사전 훈련보다 지도 훈련에서 훨씬 더 큰 성과 향상을 보였다.
- 계속적인 사전 훈련에서 Llama3-8B는 지시 증강 데이터로 훈련된 결과 재무 및 생물의학 벤치마크에서 Llama3-70B를 따라하거나 뛰어넘었다.
- 다양한 데이터셋에서 훈련된 지시 생성기는 예측할 수 없는 원시 텍스트로도 효과적으로 일반화되어 대규모 고품질 데이터 생성이 가능했다.
- 합성 지시-응답 쌍은 고지식 커버리지와 정확도를 확보한 40개 이상의 작업 카테고리에 걸쳐 분포되어 있어 효과적인 다중 작업 학습이 가능했다.
- 이 방법은 강력한 이식성과 확장성을 보였으며, 다양한 도메인과 모델 크기에서 검증된 결과를 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.