Skip to main content
QUICK REVIEW

[논문 리뷰] Extending Llama-3's Context Ten-Fold Overnight

Peitian Zhang, Ninglu Shao|arXiv (Cornell University)|2024. 04. 30.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 GPT-4를 통해 생성된 3.5K개의 합성 훈련 샘플과 QLoRA 미세조정을 활용하여 Llama-3의 컨텍스트 길이를 8K에서 80K로 확장하는 방법인 Llama-3-8B-Instruct-80K-QLoRA를 제시한다. 이 모델은 짧은 컨텍스트 작업에서도 성능을 유지하면서 장문의 컨텍스트 벤치마크에서 최신 기술 성능을 달성하며, 단일 8xA800(80GB) GPU 머신에서 8시간 내로 훈련을 완료한다.

ABSTRACT

We extend the context length of Llama-3-8B-Instruct from 8K to 80K via QLoRA fine-tuning. The entire training cycle is super efficient, which takes 8 hours on one 8xA800 (80G) GPU machine. The resulted model exhibits superior performances across a broad range of evaluation tasks, such as NIHS, topic retrieval, and long-context language understanding; meanwhile, it also well preserves the original capability over short contexts. The dramatic context extension is mainly attributed to merely 3.5K synthetic training samples generated by GPT-4 , which indicates the LLMs' inherent (yet largely underestimated) potential to extend its original context length. In fact, the context length could be extended far beyond 80K with more computation resources. Therefore, the team will publicly release the entire resources (including data, model, data generation pipeline, training code) so as to facilitate the future research from the community: \url{https://github.com/FlagOpen/FlagEmbedding}.

연구 동기 및 목표

  • Llama-3-8B-Instruct의 컨텍스트 길이를 8K에서 80K로 확장하면서도 높은 계산 자원 소모 없이 효율적이고 자원 소모가 적은 방법을 제공하는 것.
  • 강력한 대규모 언어 모델이 최소한의 합성 데이터를 사용하여 훨씬 긴 컨텍스트로 일반화할 수 있는지 조사하는 것.
  • 장문의 컨텍스트 능력을 확보하면서도 원본 모델의 짧은 컨텍스트 작업 성능을 유지하는 것.
  • 커뮤니티의 장문의 컨텍스트 LLM 연구를 가속화하기 위해 데이터, 코드, 모델 가중치를 포함한 완전히 재현 가능한 훈련 레시피를 공개하는 것.
  • 추가 컴퓨팅 자원을 활용해 동일한 방법을 사용해 80K를 초월한 더 긴 컨텍스트 길이로의 외삽 가능성 탐색

제안 방법

  • GPT-4를 사용해 3가지 작업을 포함한 총 3.5K개의 장문 컨텍스트 훈련 샘플을 생성: 단일 세부 정보 질의응답(QA), 동질적 및 이질적 컨텍스트에서의 다중 세부 정보 QA, 생애사 정리.
  • 동일한 장문의 컨텍스트(64K–80K 토큰)에서 온 질문-답변 쌍을 조합하여 다중 터닝 대화를 구성하여 지시 훈련 시나리오를 시뮬레이션.
  • 기계적 잊혀짐을 완화하기 위해 합성 데이터에 5K개의 RedPajama 및 12K개의 LongAlpaca 인스턴스를 통합.
  • Q, K, V, O 투영 및 임bedding 레이어에 LoRA를 적용한 QLoRA를 사용하며, 랭크=32, 알파=16로 설정하고 배치 크기를 8로, 선형 감쇠 학습률 5e-5를 적용.
  • 훈련 중 더 긴 컨텍스트를 지원하기 위해 RoPE 순환 위치 임베딩 기반 길이를 500K에서 200M로 확장.
  • 단일 8xA800(80GB) GPU에서 1에포크 동안 훈련을 수행하였으며, 기울기 체크포인팅을 사용하고 모델 병렬 처리 없이 8시간 내에 완료.
Figure 1: The accuracy score of Llama-3-8B-Instruct-80K-QLoRA on Needle-In-A-HayStack task. The blue vertical line indicates the training length, i.e. 80K.
Figure 1: The accuracy score of Llama-3-8B-Instruct-80K-QLoRA on Needle-In-A-HayStack task. The blue vertical line indicates the training length, i.e. 80K.

실험 결과

연구 질문

  • RQ1GPT-4와 같은 강력한 LLM이 생성한 소량의 합성 데이터로도 작은 LLM의 장문 컨텍스트 미세조정을 효과적이고 효율적으로 수행할 수 있는가?
  • RQ2미세조정된 LLM이 훈련 시 최대 길이를 초월해(예: 80K에서 128K로) 일반화할 수 있는 정도는 어느 정도인가?
  • RQ3이러한 방법으로 컨텍스트 길이를 연장하는 것이 짧은 컨텍스트 작업에서의 성능에 영향을 미치는가?
  • RQ4표준 장문 컨텍스트 벤치마크에서 확장된 모델의 성능이 원본 모델 및 다른 장문 컨텍스트 LLM과 비교해 어떻게 되는가?
  • RQ5추가 컴퓨팅 자원을 활용해 이 방법을 더 긴 컨텍스트 길이로 확장할 수 있는가?

주요 결과

  • Llama-3-8B-Instruct-80K-QLoRA 모델은 80K 훈련 컨텍스트 길이 전 구간에서 Needles-In-A-Haystack 테스크에서 100% 정확도를 기록했으며, 128K까지의 미사용 위치에서도 잘 일반화되었다.
  • Topic Retrieval 벤치마크에서, 5K에서 70K까지 평가된 모든 컨텍스트 길이에서 100% 정확도를 유지했으며, 원본 Llama-3-8B-Instruct는 9K를 초월해 실패했다.
  • LongBench에서 평균 점수 47.19를 기록하여 원본 Llama-3-8B-Instruct(43.20) 및 Llama-3-8B-Instruct-262K(43.73)를 상회했으며, Single-Doc, Multi-Doc, Summ 등 여러 작업에서 뛰어난 성능을 보였다.
  • InfiniteBench에서 LongBookQA는 30.92, LongBookSum은 14.73를 기록하여 원본 Llama-3-8B-Instruct(7.00 및 16.40)를 초월했으며, 요약 작업에서 GPT-4 성능에 가까워졌다.
  • MMLU에서 제로샷 평가 시 64.44점으로 원본 Llama-3-8B-Instruct(65.91)보다 略로 낮아 짧은 컨텍스트 능력에 약간의 희생이 있었지만, 유사 규모의 다른 오픈소스 모델보다 뛰어난 성능을 보였다.
  • 전체 훈련 과정이 단일 8xA800(80GB) GPU에서 8시간 내에 완료되어 높은 효율성과 재현 가능성을 입증했다.
Figure 2: The accuracy of Topic Retrieval task.
Figure 2: The accuracy of Topic Retrieval task.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.