Skip to main content
QUICK REVIEW

[논문 리뷰] Instruction Tuning for Large Language Models: A Survey

Shengyu Zhang, Linfeng Dong|arXiv (Cornell University)|2023. 08. 21.
Topic Modeling인용 수 96
한 줄 요약

대형 언어 모델을 위한 지시 미세조정(IT)에 대한 포괄적 고찰로, 방법론, 데이터셋, 모델, 다중 모달 확장, 도메인 적용, 효율성, 평가, 비판을 다룬다.

ABSTRACT

This paper surveys research works in the quickly advancing field of instruction tuning (IT), which can also be referred to as supervised fine-tuning (SFT)\footnote{In this paper, unless specified otherwise, supervised fine-tuning (SFT) and instruction tuning (IT) are used interchangeably.}, a crucial technique to enhance the capabilities and controllability of large language models (LLMs). Instruction tuning refers to the process of further training LLMs on a dataset consisting of extsc{(instruction, output)} pairs in a supervised fashion, which bridges the gap between the next-word prediction objective of LLMs and the users' objective of having LLMs adhere to human instructions. In this work, we make a systematic review of the literature, including the general methodology of SFT, the construction of SFT datasets, the training of SFT models, and applications to different modalities, domains and application, along with analysis on aspects that influence the outcome of SFT (e.g., generation of instruction outputs, size of the instruction dataset, etc). We also review the potential pitfalls of SFT along with criticism against it, along with efforts pointing out current deficiencies of existing strategies and suggest some avenues for fruitful research. Project Page: github.com/xiaoya-li/Instruction-Tuning-Survey

연구 동기 및 목표

  • 일반적인 IT 파이프라인과 그것의 동기를 다음 단어 예측과 지시 이행을 연결하는 다리로 설명한다.
  • 일반적으로 사용되는 IT 데이터셋과 그 구성 방법을 조사한다.
  • 대표적인 지시 미세조정 모델과 그 학습 설정을 검토한다.
  • 다중 모달 IT 데이터셋과 도메인 및 응용 분야 전반의 접근법을 검토한다.
  • IT의 효율성, 평가, 비판 및 향후 방향에 대해 논의한다.

제안 방법

  • 지시, 선택적 입력, 및 대상 출력으로 구성된 표준 IT 파이프라인을 제시한다.
  • 주석이 달린 데이터셋 변환과 LLMs를 통한 생성의 두 가지 주요 데이터 수집 방법을 설명한다.
  • 주요 IT 데이터셋과 그 특성(예: Natural Instructions, P3, xP3, Flan 2021, Unnatural Instructions, Self-Instruct, Evol-Instruct, LIMA, Super-Natural Instructions, Dolly, OpenAssistant Conversations, Baize)을 분류한다.
  • 자주 사용되는 IT 튜닝 모델과 미세조정 설정(SFT 및 RLHF 유사 단계)을 요약한다.
  • 다중 모달 IT 확장과 이미지, 음성, 비디오용 데이터셋을 설명한다.
  • 효율성 향상 및 평가 지표, 더불어 비판과 미해결 문제를 검토한다.

실험 결과

연구 질문

  • RQ1IT를 위한 지시 데이터셋을 구성하는 데 사용되는 핵심 방법론은 무엇인가?
  • RQ2지시 미세조정 모델은 주요 벤치마크와 작업에서 어떻게 비교되는가?
  • RQ3LLM에서 IT를 위한 다중 모달 및 도메인 특화 적응은 무엇이 존재하는가?
  • RQ4IT 워크플로우에서의 주요 효율성 문제와 제안된 해결책은 무엇인가?
  • RQ5형식과 프롬프트를 넘어서 실제 작업 학습에 대한 IT의 역량에 대한 비판은 무엇인가?

주요 결과

  • IT 데이터셋은 규모와 출처에서 차이가 있으며, 예시는 수만에서 수백만 개의 인스턴스에 이르고 인간이 제작한 콘텐츠와 모델이 생성한 콘텐츠를 포함한다.
  • 주요 IT 모델로 InstructGPT, BLOOMZ, Flan-T5, Alpaca, Vicuna, GPT-4-LLM, Claude, WizardLM, Evol-Instruct, LIMA, OpenAssistant 기반 변형 등이 있으며, 각각 SFT와 RLHF 유사 최적화를 결합한 독특한 미세조정 파이프라인을 가진다.
  • IT는 일반적으로 사용자 지시에 대한 정렬 및 제어 가능성을 개선하고, 독성 감소, 사실성, 지시 이행에서 많은 자동 평가 및 인간 평가에서 주목할 만한 이점을 보인다.
  • 다중 턴 및 다중 모달 IT 노력은 대화 및 비텍스트 모달리티에 지시 이행 능력을 확장하지만, 효율성 및 미보유 작업으로 일반화에 여전히 도전이 있다.
  • 비판으로는 대상 행동의 한정된 범위, 표면 패턴에 의존, 형식화 및 프롬프트를 넘어서는 실제 작업 이해에 대한 우려가 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.