[논문 리뷰] LMFlow: An Extensible Toolkit for Finetuning and Inference of Large Foundation Models
LMFlow는 확장 가능하고 경량화된 툴킷으로, 대규모 기초 모델의 미세조정 및 추론을 단순화하며, 연속적인 사전 훈련, 지시 미세조정, 파rameter 효율적 적응(LoRA), 그리고 새로운 강화학습 방법(RLHF)인 RAFT를 지원합니다. 단일 3090 GPU에서 7B 매개변수 LLaMA 모델을 다섯 시간 내에 훈련시켜, 특수 작업에서 ChatGPT와 유사하거나 그 이상의 성능을 달성합니다.
Foundation models have demonstrated a great ability to achieve general human-level intelligence far beyond traditional approaches. As the technique keeps attracting attention from the AI community, an increasing number of foundation models are becoming publicly accessible. However, a significant shortcoming of most of these models lies in their performance in specialized-domain and task-specific applications, necessitating domain- and task-aware fine-tuning to develop effective scientific language models. As the number of available foundation models and specialized tasks keeps growing, the job of training scientific language models becomes highly nontrivial. In this paper, we initiate steps to tackle this issue. We introduce an extensible and lightweight toolkit, LMFlow, which aims to simplify the domain- and task-aware finetuning of general foundation models. LMFlow offers a complete finetuning workflow for a foundation model to support specialized training with limited computing resources. Furthermore, it supports continuous pretraining, instruction tuning, parameter-efficient finetuning, alignment tuning, inference acceleration, long context generalization, model customization, and even multimodal finetuning, along with carefully designed and extensible APIs. This toolkit has been thoroughly tested and is available at https://github.com/OptimalScale/LMFlow.
연구 동기 및 목표
- 다양한 전문화된 작업에 걸쳐 대규모 기초 모델의 미세조정이 점점 더 복잡해지는 문제를 해결하기 위해.
- 제한된 컴퓨팅 자원을 가진 연구자와 개발자들을 위해 통합적이고 확장 가능하며 자원 효율적인 툴킷을 제공하기 위해.
- 연속적인 사전 훈련, 지시 미세조정, 인간 피드백을 통한 강화학습(RLHF)을 포함한 전체 미세조정 파이프라인을 단순화하기 위해.
- 질의 응답, 번역, 전문가 상담과 같은 작업을 위해 최소한의 하드웨어로 개인 맞춤형 모델 훈련을 가능하게 하기 위해.
- 간편하고 확장 가능한 API와 자동 평가 프레임워크를 제공하여 재현 가능성과 접근성을 향상시키기 위해.
제안 방법
- LMFlow는 네 단계의 미세조정 워크플로우를 구현합니다: 도메인 적응, 작업 적응, 지시 미세조정, 인간 피드백을 통한 강화학습(RLHF).
- 저랭크 적응(LoRA)을 통한 파rameter 효율적 미세조정을 지원하여 계산 및 메모리 비용을 감소시킵니다.
- 보상 순위를 사용하는 보상 모델링 대신 보상 순위를 활용함으로써 RLHF 파이프라인을 단순화하는 새로운 RLHF 알고리즘인 RAFT(Reward rAnked FineTuning)를 개발했습니다.
- 다양한 훈련 데이터를 지원하기 위해 'text_only' 및 'text2text'와 같은 유형을 가진 표준화된 JSON 기반 데이터 형식을 사용합니다.
- 간소화된 추론 프레임워크를 포함하고 있으며, Hugging Face 모델과 통합되어 원활한 배포를 지원합니다.
- 평가에는 음의 로그우도(NLL)를 사용하며, 이는 최종 작업 정확도와 강한 상관관계를 보이며, 퍼플렉서티(PPL)에 내재된 편향을 피할 수 있습니다.
실험 결과
연구 질문
- RQ1경량이고 확장 가능한 툴킷이 다양한 전문화된 작업에 걸쳐 대규모 기초 모델의 미세조정을 단순화할 수 있는가?
- RQ2RAFT 알고리즘이 생성 모델을 위한 RLHF 프로세스를 단순화하고 향상시키는 데 얼마나 효과적인가?
- RQ3LoRA를 통한 파rameter 효율적 미세조정이 제한된 하드웨어에서 전체 미세조정과 유사한 성능을 달성할 수 있는가?
- RQ4NLL가 인간의 레이블 없이도 신뢰할 수 있는 자동 평가 지표로 기능할 수 있는가?
- RQ5제한된 자원을 가진 단일 GPU에서 훈련된 LLaMA 모델의 실질적인 성능 한계는 무엇인가?
주요 결과
- 단일 NVIDIA 3090 GPU에서 70억 매개변수의 LLaMA 모델을 개인 맞춤형 미세조정하여 다섯 시간 내에 훈련시켰으며, 제한된 하드웨어에서의 높은 효율성을 입증했습니다.
- 이 툴킷은 연속적인 사전 훈련, 지시 미세조정, 파rameter 효율적 미세조정(LoRA), RLHF를 성공적으로 지원하여 기초 모델의 완전한 커스터마이제이션을 가능하게 했습니다.
- LMFlow로 미세조정된 330억 매개변수의 LLaMA 모델은 특정 벤치마크에서 ChatGPT와 유사하거나 그 이상의 성능을 달성했습니다.
- NLL 지표는 일반 지식 기반 질문 응답 정확도와 강한 상관관계를 보이며, 이는 자동 평가 지표로서의 신뢰성을 입증합니다.
- RAFT 기반 RLHF는 지시 따르기 및 대화 작업에서 강력한 성능을 유지하면서도 강화학습 파이프라인을 크게 단순화했습니다.
- 7B, 13B, 33B, 65B LLaMA 버전의 모델 가중치는 학술 목적을 위해 공개되어 있으며, 즉시 질문 응답 서비스에 배포할 수 있습니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.