Skip to main content
QUICK REVIEW

[논문 리뷰] Fine Tuning LLM for Enterprise: Practical Guidelines and Recommendations

Mathav Raj J, Kushala VM|arXiv (Cornell University)|2024. 03. 23.
Metallurgy and Material Forming인용 수 30
한 줄 요약

본 논문은 PEFT 방법(LoRA/QLoRA), 양자화, 맞춤 데이터 전처리를 활용하여 독점 문서와 코드에서 LLaMA를 미세 조정하는 실용적 지침과 경험적 평가 및 RAG 비교를 제공합니다.

ABSTRACT

There is a compelling necessity from enterprises for fine tuning LLMs (Large Language Models) o get them trained on proprietary domain knowledge. The challenge is to imbibe the LLMs with domain specific knowledge using the most optimial resource and cost and in the best possible time. Many enterprises rely on RAG (Retrieval Augmented Generation) which does not need LLMs to be ine-tuned but they are limited by the quality of vector databases and their retrieval capabilities rather than the intrinsic capabilities of the LLMs themselves. In our current work we focus on fine tuning LLaMA, an open source LLM using proprietary documents and code from an enterprise repository and use the fine tuned models to evaluate the quality of responses. As part of this work, we aim to guide beginners on how to start with fine tuning an LLM for documentation and code by making educated guesses on size of GPU required and options that are available for formatting the data. We also propose pre processing recipes for both documentation and code to prepare dataset in different formats. The proposed methods of data preparation for document datasets are forming paragraph chunks, forming question and answer pairs and forming keyword and paragraph chunk pairs. For code dataset we propose forming summary and function pairs. Further, we qualitatively evaluate the results of the models for domain specific queries. Finally, we also propose practical guidelines and recommendations for fine tuning LLMs.

연구 동기 및 목표

  • 도메인 특정 데이터로 LLM을 미세 조정하도록 기업을 동기부여하여 정확도를 높이고 대기 시간 감소 및 프라이버시 문제를 줄인다.
  • 텍스트 및 코드 미세 조정을 위한 데이터 준비, 계산 추정 및 데이터 세트 형식에 대해 초보자를 안내한다.
  • 양자화, 그래디언트 누적, 및 PEFT(LoRA/QLoRA)가 자원 사용 및 성능에 미치는 영향을 평가한다.
  • 기업 환경에서 LLM을 미세 조정하기 위한 실행 가능한 권고안과 워크플로를 제시한다.

제안 방법

  • 가용 하드웨어에서 미세 조정에 영향을 주는 요인들을 메모리와 계산의 트레이드오프를 포함하여 논의한다.
  • 텍스트 및 코드 데이터셋에 대한 데이터 전처리 절차를 설명하여 인스트럭션-튜닝 형식을 만든다.
  • PEFT 기법(LoRA와 QLoRA)와 서로 다른 모델 크기에 대한 매개변수 효율성 이점을 설명한다.
  • 워크플로우 제시: 데이터 전처리, PEFT 설정, 손실 최소화까지의 미세 조정, 그리고 RAG 파이프라인에서의 평가.
  • 독점 문서 및 코드 말뭉치를 대상으로 LLaMA 2를 사용한 경험적 실험을 수행하여 양자화, LoRA 랭크/알파, 전체 미세 조정 가능성을 연구한다.
Figure 1: Fine tuning Workflow (with LLaMA model as an example)
Figure 1: Fine tuning Workflow (with LLaMA model as an example)

실험 결과

연구 질문

  • RQ1양자화, PEFT 방법(LoRA/QLoRA), 그리고 그래디언트 누적이 기업 규모의 LLM에서 미세 조정 효율성과 메모리 사용에 어떤 영향을 미치는가?
  • RQ2텍스트와 코드에 대한 어떤 데이터 전처리 형식이 인스트럭션-튜닝된 LLaMA 모델에서 도메인 특화 성능을 가장 잘 이끄는가?
  • RQ3기업 문서와 코드에서 미세 조정이 RAG 기반 검색 품질과 환각 경향에 어떤 영향을 미치는가?
  • RQ4제한된 하드웨어 자원을 고려할 때 모델 크기, 데이터세트 크기 및 훈련 구성의 실용적인 가이드라인은 무엇인가?

주요 결과

  • 양자화(예: 8비트)는 GPU 메모리를 약 71% 감소시키고 더 큰 배치 크기를 가능하게 하지만 미세 조정 중 추론 시간이 길어지는 비용이 있다.
  • LoRA/QLoRA는 매개변수 효율적인 미세 조정을 가능하게 하여 한정된 메모리에서도 대형 모델 미세 조정이 가능하게 하며, 더 작은 크기의 경우 고성능 GPU에서 전체 모델 미세 조정도 여전히 가능하다.
  • 데이터 전처리 선택(원시(raw), 키워드, 제목(heading), 요약 기반 형식)은 응답 품질에 서로 다른 영향을 미치며, 작업에 따라 더 간결하거나 상세한 답변을 내놓는다.
  • RAG 파이프라인에서 미세 조정된 모델은 더 정확하고 문서 스타일의 단계적 응답을 제공하여 기본 사전학습 모델에 비해 환각을 줄인다.
  • 코드 중심의 미세 조정은 적절히 조정된 LoRA 랭크와 알파에서 강력한 이점을 보이나, 랭크/알파를 과도하게 설정하면 생성 코드에서 환각으로 이어질 수 있다.
Figure 2: Inference time of fine tuned Llama 2 7B Chat model
Figure 2: Inference time of fine tuned Llama 2 7B Chat model

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.