Skip to main content
QUICK REVIEW

[논문 리뷰] Instruction Tuning with GPT-4

Baolin Peng, Chunyuan Li|arXiv (Cornell University)|2023. 04. 06.
Topic Modeling인용 수 186
한 줄 요약

본 논문은 GPT-4를 이용해 52K개의 영어 및 중국어 지시 따르기 데이터를 생성하여 LLaMA 모델을 미세 조정하고, 제로샷 지시 수행 성능을 크게 달성하며 미지의 태스크에서 GPT-4와 비교 가능한 결과를 얻고, 데이터와 코드를 공개한다.

ABSTRACT

Prior work has shown that finetuning large language models (LLMs) using machine-generated instruction-following data enables such models to achieve remarkable zero-shot capabilities on new tasks, and no human-written instructions are needed. In this paper, we present the first attempt to use GPT-4 to generate instruction-following data for LLM finetuning. Our early experiments on instruction-tuned LLaMA models show that the 52K English and Chinese instruction-following data generated by GPT-4 leads to superior zero-shot performance on new tasks to the instruction-following data generated by previous state-of-the-art models. We also collect feedback and comparison data from GPT-4 to enable a comprehensive evaluation and reward model training. We make our data generated using GPT-4 as well as our codebase publicly available.

연구 동기 및 목표

  • 기계로 생성된 데이터를 사용하여 오픈 소스 LLM의 지시 학습을 촉진한다.
  • 이전 데이터에 비해 GPT-4가 생성한 지시 데이터가 제로샷 일반화를 향상시키는지 조사한다.
  • 영어/중국어 간 교차 언어 지시 이행 능력을 탐구한다.
  • 평가 및 디코딩을 안내하기 위해 GPT-4 비교로부터 보상 모델을 개발한다.
  • 연구 커뮤니티에 GPT-4가 생성한 데이터와 튜닝 파이프라인을 공개적으로 제공한다.

제안 방법

  • GPT-4를 사용하여 52K개의 Alpaca 지시 데이터의 영어 태스크를 생성한다(각 지시마다 한 응답).
  • ChatGPT를 통해 지시를 중국어로 번역하고 중국어로 응답하여 중국어 지시 이행 데이터를 생성한다.
  • GPT-4가 모델 출력을 평가·비교하도록 하여 보상 모델을 학습시키는 비교 데이터를 생성한다.
  • GPT-4가 생성한 데이터를 사용해 LLaMA-7B 모델을 학습시켜 LLaMA-GPT4와 LLaMA-GPT4-CN을 얻는다.
  • 세 가지 평가 설정: 인간 정렬(HHH 기준), GPT-4 기반 자동 평가, 그리고 Unnatural Instructions에 대한 ROUGE-L.
  • GPT-4가 생성한 데이터와 미세조정 된 모델 체크포인트 및 코드베이스를 공개한다.

실험 결과

연구 질문

  • RQ1이전 데이터 소스에 비해 GPT-4가 생성한 지시 데이터가 보지 못한 태스크에서 제로샷 일반화를 향상시키는가?
  • RQ2GPT-4 데이터를 이용한 지시 학습이 보지 않은 지시에서 GPT-4에 근접한 성능을 달성할 수 있는가?
  • RQ3오픈 소스 LLM에서 영어 대 중국어의 교차 언어 지시 이행 일반화는 어떻게 나타나는가?
  • RQ4GPT-4 기반 보상 모델이 지시 이행 출력의 평가 및 디코딩을 효과적으로 안내할 수 있는가?
  • RQ5이 파이프라인에서 데이터 규모, 모델 크기 및 RLHF 통합에 대한 실질적 고려사항은 무엇인가?

주요 결과

  • GPT-4가 생성한 지시 데이터는 GPT-3.5 기반 데이터에 비해 보지 못한 태스크에서 뛰어난 제로샷 성능을 나타낸다.
  • LLaMA-GPT4(7B)는 자동 평가에서 ChatGPT 및 GPT-4와 같은 강력한 모델에 대해 13B Alpaca 및 LLaMA 기준선을 자주 능가한다.
  • GPT-4 지시 튜닝된 LLaMA는 인간 평가 전반의 정렬 기준에서 GPT-4에 근접하게 일치하여 특정 작업에서 교사 모델에 맞먹는 GPT-4 데이터를 시사한다.
  • 교차 언어 결과는 GPT-4로부터 얻은 중국어 지시 이행 데이터가 효과적인 중국어 모델을 가능하게 하며 교차 언어 일반화 분석을 가능하게 한다.
  • GPT-4 기반 보상 모델링은 디코딩 및 평가에 일관된 순위 신호를 제공하여 인간 및 GPT-4 피드백과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.