[논문 리뷰] Panda LLM: Training Data and Evaluation for Open-Sourced Chinese Instruction-Following Large Language Models
Panda LLM는 중국어 지시에 따라 행동하는 최초의 오픈소스화된 대규모 언어 모델을 소개하며, 중국어 위키, 뉴스, COIG를 포함한 다양한 고품질 중국어 데이터셋을 바탕으로 이중 단계의 피니테이닝을 통해 훈련되었다. 이는 오픈소스 중국어 LLM 중 최고 수준의 성능을 달성했으며, 모델 가중치, 데이터, 코드를 공개하여 AI의 투명성, 신뢰성, 민주화를 촉진한다.
This project focuses on enhancing open-source large language models through instruction-tuning and providing comprehensive evaluations of their performance. We explore how various training data factors, such as quantity, quality, and linguistic distribution, influence the performance of instruction-tuned models trained on publicly accessible high-quality instruction datasets for both English and Chinese languages. Our goal is to supplement evaluation with quantitative analyses, providing valuable insights for the continued advancement of open-source chat models. Our model, data, and code are publicly available for others to use and build upon.
연구 동기 및 목표
- 신뢰할 수 있고, 투명하며, 사용자 맞춤형 오픈소스 중국어 지시에 따라 행동하는 대규모 언어 모델을 개발하기 위해.
- 훈련 데이터 요소—양, 품질, 언어적 분포—가 지시에 맞춰 조정된 모델 성능에 미치는 영향을 조사하기 위해.
- 기존 오픈소스 중국어 LLM을 처음으로 종합적으로 평가하기 위해.
- 모델 체크포인트, 훈련 데이터, 소스 코드의 공개를 통해 고품질 중국어 LLM에 대한 광범위한 접근을 가능하게 하기 위해.
- 연구자, 개발자, 중소기업이 접근 가능하고 사용자 맞춤형으로 조정 가능한 LLM을 통해 AI의 민주화를 지원하기 위해.
제안 방법
- 다양한 중국어 코퍼스에서의 사전 훈련과 지시 훈련을 거친 이중 단계 훈련 방식을 사용해 LLaMA 기반 모델을 피니테이닝하였다.
- 다섯 개의 중국어 단일어 종속 코퍼스와 COIG 데이터셋에서 고품질 지시 훈련 데이터셋을 구성하였으며, 다양한 분야와 언어 스타일을 포함하였다.
- Wei 등(2021)의 접근 방식을 따르며 프롬프트 템플릿 "Human: [지시] \n\nAssistant: [응답]"을 적용하여 지시 훈련을 수행하였다.
- LLaMA 모델 아키텍처를 활용하였으며, 사전 정규화, SwiGLU 활성화 함수, 로테이션 임bedding 등의 개선 사항을 적용하였다.
- 라이선싱 제약으로 인해 원본 LLaMA 가중치 대비 모델 가중치의 차이로 제공되었으며, 변환 스크립트도 함께 제공되었다.
- 7B, 13B, 33B, 65B 파라미터 변형을 위해 총 1.4T 토큰을 포함하는 7개의 공개된 데이터셋 조합을 사용해 사전 훈련을 수행하였으며, 하이퍼파라미터는 최적화하였다.
실험 결과
연구 질문
- RQ1훈련 데이터의 양, 품질, 언어적 분포 변화가 지시에 따라 조정된 중국어 LLM의 성능에 어떤 영향을 미치는가?
- RQ2기존 오픈소스 중국어 지시에 따라 행동하는 LLM 간의 상대적 성능은 어떻게 되며, Panda LLM은 어떻게 비교되는가?
- RQ3이중 단계 훈련 방식(사전 훈련 + 지시 훈련)이 중국어 지시에 따라 행동하는 작업에서 뛰어난 성능을 낼 수 있는가?
- RQ4기밀 데이터나 모델에 접근할 수 없는 상황에서 오픈소스 중국어 LLM이 얼마나 높은 성능을 달성할 수 있는가?
- RQ5글로벌 사용을 위해 오픈소스 LLM을 어떻게 더 투명하고, 신뢰할 수 있으며, 사용자 맞춤형으로 만들 수 있는가?
주요 결과
- Panda LLM은 동일한 파라미터 크기의 이전에 공개된 오픈소스 중국어 LLM 전부를 지시 따르기 벤치마크에서 능가한다.
- 이중 단계 훈련 방식—다양한 중국어 코퍼스에서의 사전 훈련 후 지시 훈련—이 지시 따르기 능력을 크게 향상시킨다.
- 모델은 추론, 요약, 질의 응답과 같은 다양한 유형의 지시에 대해 강력한 제로샷 일반화 능력을 보여준다.
- 평가 결과, 기존 오픈소스 중국어 LLM 간에 뚜렷한 성능 격차가 존재하며, 이는 고품질 훈련 데이터와 피니테이닝의 중요성을 드러낸다.
- LLaMA 가중치에서의 차이로 제공된 모델 가중치 덕분에, 원본 LLaMA 가중치에 접근한 사용자가 완전한 재현성과 맞춤형 설정을 구현할 수 있다.
- 향후 더 큰 모델인 Panda-13B와 Panda-33B의 공개를 계획하며, 오픈소스화, 확장 가능하고 다국어 지원이 가능한 LLM의 기반을 마련한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.