[論文レビュー] Instruction Tuning with GPT-4
本論文はGPT-4を用いて52Kの英語および中国語の指示遵守データを生成し、LLaMAモデルを微調整して、未知タスクで強力なゼロショット指示遵守性能を達成し、GPT-4と同等の結果を示す。データとコードの公開を伴う。
Prior work has shown that finetuning large language models (LLMs) using machine-generated instruction-following data enables such models to achieve remarkable zero-shot capabilities on new tasks, and no human-written instructions are needed. In this paper, we present the first attempt to use GPT-4 to generate instruction-following data for LLM finetuning. Our early experiments on instruction-tuned LLaMA models show that the 52K English and Chinese instruction-following data generated by GPT-4 leads to superior zero-shot performance on new tasks to the instruction-following data generated by previous state-of-the-art models. We also collect feedback and comparison data from GPT-4 to enable a comprehensive evaluation and reward model training. We make our data generated using GPT-4 as well as our codebase publicly available.
研究の動機と目的
- 機械生成データを用いてオープンソースLLMの指示調整を促進する。
- GPT-4生成の指示データが従来データに対してゼロショット一般化を改善するかを調査する。
- 英語/中国語のクロス言語指示遵守能力を探る。
- 評価とデコードを指針するためにGPT-4比較から報酬モデルを開発する。
- 研究コミュニティにGPT-4生成データと微調整パイプラインを公開する。
提案手法
- GPT-4を用いて52KのAlpaca指示に対する英語の指示遵守データを生成する(各指示につき1つの応答)。
- 指示をChatGPTで中国語に翻訳し、中国語で回答して中国語の指示遵守データを作成する。
- GPT-4にモデル出力を評価・比較させて報酬モデルを訓練する比較データを作成する。
- GPT-4生成データでLLaMA-7Bモデルを訓練し、LLaMA-GPT4とLLaMA-GPT4-CNを得る。
- 3つの評価設定を用いる:人間の整合性(HHH基準)、GPT-4を用いた自動評価、Unnatural InstructionsのROUGE-L。
- GPT-4生成データと微調整済みモデルのチェックポイントおよびコードベースを公開する。
実験結果
リサーチクエスチョン
- RQ1GPT-4生成の指示データは、従来のデータ源と比較して未知のタスクにおけるゼロショット一般化を改善するか?
- RQ2GPT-4データによる指示調整は、未知の指示に対してGPT-4に近い性能を達成できるか?
- RQ3オープンソースLLMにおける英語と中国語のクロス言語指示遵守の一般化はどうなるか?
- RQ4GPT-4駆動の報酬モデルは、指示遵守出力の評価とデコードを効果的に導くことができるか?
- RQ5このパイプラインにおけるデータ規模、モデルサイズ、およびRLHF統合の実務的考慮事項は何か?
主な発見
- GPT-4-generated instruction data yields superior zero-shot performance on unseen tasks compared with GPT-3.5-based data.
- LLaMA-GPT4 (7B) often outperforms 13B Alpaca and LLaMA baselines in automatic evaluations against strong models like ChatGPT and GPT-4.
- GPT-4–instruction-tuned LLaMA closely matches GPT-4 in alignment criteria across human evaluation, suggesting GPT-4 data can rival the teacher model for certain tasks.
- Cross-language results show that Chinese instruction-following data (from GPT-4) enables effective Chinese models and enables cross-language generalization analyses.
- GPT-4 based reward modeling provides consistent ranking signals for decoding and evaluation, aligning with human and GPT-4 feedback.
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。