Skip to main content
QUICK REVIEW

[논문 리뷰] Giraffe: Adventures in Expanding Context Lengths in LLMs

Arka Pal, Deep Karkhanis|arXiv (Cornell University)|2023. 08. 21.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 LLaMA 및 LLaMA2에서 파생된 13B 파라미터 LLM인 Giraffe를 제안하며, 선형 보간을 통한 로타리 위치 임베딩(RoPE)을 사용해 컨텍스트 길이를 최대 32k 토큰으로 연장합니다. 핵심 발견은 선형 스케일링이 다른 방법보다 우수하며, 추론 시 스케일 인자값을 늘릴수록 추가로 성능 향상이 이루어지지만, 24k 토큰을 초과하면 성능 저하가 심각하게 나타나는 것으로 드러났습니다. 이는 합리적인 퍼플렉서티(perplexity)를 유지하고 있음에도 불구하고 그렇습니다.

ABSTRACT

Modern large language models (LLMs) that rely on attention mechanisms are typically trained with fixed context lengths which enforce upper limits on the length of input sequences that they can handle at evaluation time. To use these models on sequences longer than the train-time context length, one might employ techniques from the growing family of context length extrapolation methods -- most of which focus on modifying the system of positional encodings used in the attention mechanism to indicate where tokens or activations are located in the input sequence. We conduct a wide survey of existing methods of context length extrapolation on a base LLaMA or LLaMA 2 model, and introduce some of our own design as well -- in particular, a new truncation strategy for modifying the basis for the position encoding. We test these methods using three new evaluation tasks (FreeFormQA, AlteredNumericQA, and LongChat-Lines) as well as perplexity, which we find to be less fine-grained as a measure of long context performance of LLMs. We release the three tasks publicly as datasets on HuggingFace. We discover that linear scaling is the best method for extending context length, and show that further gains can be achieved by using longer scales at evaluation time. We also discover promising extrapolation capabilities in the truncated basis. To support further research in this area, we release three new 13B parameter long-context models which we call Giraffe: 4k and 16k context models trained from base LLaMA-13B, and a 32k context model trained from base LLaMA2-13B. We also release the code to replicate our results.

연구 동기 및 목표

  • 고정된 길이의 시퀀스로 훈련된 LLM에 대해, 제로샷 컨텍스트 길이 외삽 방법을 평가하고 비교하는 것.
  • 기존 훈련 길이를 초월해 컨텍스트를 연장하기 위한 새로운 위치 인코딩 전략(예: 잘라낸 기저 기반)을 개발하고 테스트하는 것.
  • 기본 LLaMA 및 LLaMA2 모델에서 파생된 세 가지 새로운 장기 컨텍스트 LLM(Giraffe-4k, 16k, 32k)을 도입하고 배포하는 것.
  • 장기 컨텍스트 성능을 세밀하게 평가할 수 있도록 세 가지 새로운 벤치마크 데이터셋(LongChat-Lines, FreeFormQA, AlteredNumericQA)을 제작하고 배포하는 것.
  • 퍼플렉서티만으로는 장기 컨텍스트 능력을 평가하는 데 부적절하며, 작업 기반 벤치마크가 실제 성능 저하를 드러내는 것을 입증하는 것.

제안 방법

  • 다양한 스케일 인자값을 사용해 선형 보간을 통한 로타리 위치 임베딩(RoPE)을 적용해 기본 LLaMA 및 LLaMA2 모델을 피나이팅했습니다.
  • 기존 컨텍스트 길이를 초월한 외삽을 향상시키기 위해 새로운 잘라낸 기저 기반(positional encoding)을 제안했습니다.
  • 세 가지 새로운 공개 데이터셋(LongChat-Lines(키-밸류 검색), FreeFormQA, AlteredNumericQA(장문 문서 기반 질문-답변))을 사용해 방법을 평가했습니다.
  • 일관된 평가를 확보하기 위해 고정된 프롬프트 구조를 사용해 지시어 피나이팅(IFT)을 적용했습니다.
  • 기본 지표로 문서 코퍼스에 대한 퍼플렉서티를 사용했지만, 장기 컨텍스트 추론 정확도를 포괄하지 못하는 한계를 강조했습니다.
  • HuggingFace에 4k, 16k, 32k 컨텍스트 길이를 가진 세 개의 13B 모델에 대한 코드와 가중치를 배포했습니다.

실험 결과

연구 질문

  • RQ1다른 방법들(예: 사인파, 학습된, 스케일된 RoPE)과 비교해 선형 보간을 통한 로타리 위치 임베딩이 장기 컨텍스트 LLM의 제로샷 외삽 성능에서 최고의 성능을 보이는가?
  • RQ2장기 컨텍스트 시퀀스에서 질문과 답변의 위치가 다양한 컨텍스트 길이에서 모델 성능에 미치는 영향은 어떠한가?
  • RQ3위치 인코딩에 대한 잘라낸 기저 기반은 모델의 원래 컨텍스트 길이를 초월한 진정한 외삽을 가능하게 할 수 있으며, 선형 스케일링과 비교해 어떤가?
  • RQ4퍼플렉서티와 실제 장기 컨텍스트 추론 정확도 사이의 상관관계는 어느 정도이며, 맞춤형 벤치마크는 퍼플렉서티가 포착하지 못한 성능 저하를 드러내는가?
  • RQ5피나이팅 스케일을 초월해 추론 시 스케일 인자값을 늘리는 것이 성능 향상에 기여하는가? 그리고 이러한 향상에 한계가 존재하는가?

주요 결과

  • 선형 보간을 통한 로타리 위치 임베딩은 모든 평가 작업에서 학습된 위치 인코딩 및 사인파 인코딩을 포함한 다른 방법들보다 뚜렷하게 뛰어난 성능을 보였습니다.
  • FreeFormQA 및 AlteredNumericQA에서 컨텍스트 길이가 24k를 초과하면 성능 저하가 관찰되었으며, 이는 퍼플렉서티가 안정된 상태임에도 불구하고, 일관성과 추론 정확도 사이의 괴리가 있음을 시사합니다.
  • 질문을 컨텍스트의 끝부분에 두는 것이 FreeFormQA 및 AlteredNumericQA에서 긴 길이에서 정확도를 향상시켰으며, 이는 장기 시퀀스에서 어텐션 메커니즘이 최근 토큰을 선호할 수 있음을 시사합니다.
  • 위치 인코딩에 대한 잘라낸 기저 기반은 유망한 외삽 능력을 보였지만, 선형 스케일링을 능가하진 못했으며, 향후 추가 연구가 필요합니다.
  • 피나이팅 스케일을 초월해 추론 시 스케일 인자값을 늘리면 성능 향상이 이루어졌지만, 2배 요인을 초과하면 성능 향상이 정체되었으며, 이는 이 접근법의 실용적 한계를 시사합니다.
  • 퍼플렉서티는 장기 컨텍스트 성능 평가에 있어 거친 지표로 밝혀졌으며, 높은 퍼플렉서티를 유지하면서도 추론 작업에서 실패하는 모델들이 존재함을 확인했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.