[論文レビュー] Panda LLM: Training Data and Evaluation for Open-Sourced Chinese Instruction-Following Large Language Models
Panda LLMは、中国語の指示に従う最初のオープンソース化された大規模言語モデルを紹介する。中国語のWikipedia、ニュース、COIGを含む多様な高品質な中国語データセットを用いた二段階のファインチューニングにより訓練された。Panda LLMは、オープンソースの中国語LLMの中で最先端のパフォーマンスを達成し、モデル重み、データ、コードを公開することで、AIの透明性、信頼性、民主化を促進する。
This project focuses on enhancing open-source large language models through instruction-tuning and providing comprehensive evaluations of their performance. We explore how various training data factors, such as quantity, quality, and linguistic distribution, influence the performance of instruction-tuned models trained on publicly accessible high-quality instruction datasets for both English and Chinese languages. Our goal is to supplement evaluation with quantitative analyses, providing valuable insights for the continued advancement of open-source chat models. Our model, data, and code are publicly available for others to use and build upon.
研究の動機と目的
- 信頼性があり、透明性があり、カスタマイズ可能なオープンソースの中国語指示に従う大規模言語モデルの開発。
- トレーニングデータ要因(量、品質、言語的分布)が指示ファインチューニングモデルのパフォーマンスに与える影響を調査すること。
- これまでにない包括的な評価を通じて、既存のオープンソース中国語LLMを評価すること。
- モデルチェックポイント、トレーニングデータ、ソースコードの公開を通じて、高品質な中国語LLMへの広範なアクセスを可能にすること。
- 研究者、開発者、中小企業(SMEs)がアクセス可能でカスタマイズ可能なLLMを提供することで、AIの民主化を支援すること。
提案手法
- 多様な中国語コーパスで事前学習し、その後指示ファインチューニングを行う二段階のトレーニングアプローチを用いて、LLaMAベースモデルをファインチューニングした。
- 5つの中国語単語彙集とCOIGデータセットから成る高品質な指示ファインチューニングデータセットを構築し、多様な分野と言語的スタイルをカバーした。
- Weiら(2021)のアプローチに従い、プロンプトテンプレート「Human: [指示] \n\nAssistant: [応答]」を適用して指示ファインチューニングを実施した。
- Pre-normalization、SwiGLU活性化関数、回転埋め込みを含む、LLaMAモデルアーキテクチャの改良を活用した。
- ライセンス制約のため、元のLLaMA重みからのパラメータ差分としてモデル重みを公開し、変換スクリプトを併記した。
- 7B、13B、33B、65Bパラメータバージョンのハイパーパrameterを最適化し、合計1.4Tトークンに達する7つの公開データセットの混合を用いて事前学習を行った。
実験結果
リサーチクエスチョン
- RQ1トレーニングデータの量、品質、言語的分布の変化が、指示ファインチューニングされた中国語LLMのパフォーマンスに与える影響は何か?
- RQ2オープンソースの中国語指示に従うLLM同士の相対的パフォーマンスはどのようになっており、Panda LLMはその中でどのように位置づけられるか?
- RQ3二段階トレーニングアプローチ(事前学習+指示ファインチューニング)は、中国語の指示に従うタスクで優れたパフォーマンスを発揮できるか?
- RQ4特許データや特許モデルにアクセスできない状況でも、オープンソースの中国語LLMがどれほど最先端の結果を達成できるか?
- RQ5グローバル利用を想定した場合、オープンソースLLMをどのようにしてより透明性があり、信頼性があり、カスタマイズ可能にすることができるか?
主な発見
- Panda LLMは、同等のパラメータサイズを持つ、これまでに公開されたすべてのオープンソース中国語LLMよりも、指示に従うベンチマークで優れたパフォーマンスを示した。
- 二段階トレーニングアプローチ(多様な中国語コーパスでの事前学習+指示ファインチューニング)は、指示に従う能力を顕著に向上させた。
- モデルは、推論、要約、質問応答を含む多様な指示タイプにおいて、強力なゼロショット一般化性能を示した。
- 評価結果から、既存のオープンソース中国語LLM間には顕著なパフォーマンス格差が確認され、高品質なトレーニングデータとファインチューニングの重要性が浮き彫りになった。
- LLaMA重みからのパラメータ差分としてのモデル重みの公開により、元のLLaMA重みにアクセスできるユーザーによる完全な再現性とカスタマイズが可能になった。
- Panda-13BやPanda-33Bといったより大きなモデルのリリースを予定しており、今後のオープンソースでスケーラブルかつマルチリンガルなLLMの基盤を確立した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。