Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Laws of RoPE-based Extrapolation

Xiaoran Liu, Hang Yan|arXiv (Cornell University)|2023. 10. 08.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 RoPE 기반 외삽에 대한 통합 이론적 프레임워크인 'RoPE 기반 외삽의 스케일링 법칙'을 제안한다. 이는 원형 기저(10,000보다 작거나 큰 값)를 조정하고, 컨텍스트 길이를 미세조정함으로써 RoPE 기반 LLM의 외삽 성능을 향상시키는 메커니즘을 설명한다. 연구는 16K 컨텍스트 길이에서 기저 값을 500 또는 1,000,000으로 설정해 미세조정할 경우, LLaMA2 7B 및 13B 모델이 100만 토큰까지 외삽할 수 있음을 입증한다. 기저 값과 조정 길이 사이에는 성능이 훈련 길이를 초월할 때를 결정짓는 중요한 주기적 관계가 존재한다.

ABSTRACT

The extrapolation capability of Large Language Models (LLMs) based on Rotary Position Embedding is currently a topic of considerable interest. The mainstream approach to addressing extrapolation with LLMs involves modifying RoPE by replacing 10000, the rotary base of $θ_n={10000}^{-2n/d}$ in the original RoPE, with a larger value and providing longer fine-tuning text. In this work, we first observe that fine-tuning a RoPE-based LLM with either a smaller or larger base in pre-training context length could significantly enhance its extrapolation performance. After that, we propose extbf{ extit{Scaling Laws of RoPE-based Extrapolation}}, a unified framework from the periodic perspective, to describe the relationship between the extrapolation performance and base value as well as tuning context length. In this process, we also explain the origin of the RoPE-based extrapolation issue by extbf{ extit{critical dimension for extrapolation}}. Besides these observations and analyses, we achieve extrapolation up to 1 million context length within only 16K training length on LLaMA2 7B and 13B.

연구 동기 및 목표

  • 표준 10,000 기저 외에 더 작은 값과 더 큰 값의 원형 기저가 RoPE 기반 LLM의 외삽 성능을 향상시키는 데 기여하는 반직관적인 현상에 대해 탐구한다.
  • RoPE 외삽 실패의 근본 원인을 주기성과 임계 차원 분석을 통해 규명하고, 이를 해결하는 메커니즘을 규명한다.
  • 원형 기저, 미세조정 컨텍스트 길이, 외삽 성능 간의 통합 이론적 프레임워크를 수립한다.
  • LLaMA2 7B 및 13B 모델에 대해 프레임워크를 실증적으로 검증하여, 16K 미세조정만으로도 100만 토큰 컨텍스트 길이의 외삽을 달성한다.

제안 방법

  • 훈련 길이를 초월한 RoPE의 행동을 모델링하기 위해 주기적 관점 제안하며, 각도 해상도와 주기성이 주의 안정성에 미치는 영향을 분석한다.
  • 외삽 성능 저하 원인을 설명하기 위해 '외삽을 위한 임계 차원' 개념을 도입한다.
  • RoPE의 삼각함수 성질을 활용해 원형 기저, 미세조정 컨텍스트 길이, 외삽 한계 간의 수학적 스케일링 법칙을 유도한다.
  • LLaMA2 모델에서 4K 및 16K 미세조정 길이에 대해 기저 값을 500에서 1,000,000 사이로 다양하게 설정해 실증 테스트를 수행한다.
  • Books3 데이터셋에서 퍼즐리티 평가를 통해 프레임워크를 검증하고, 주의 점수 동역학을 분석한다.
  • 기저 값 감소가 각도 해상도 향상으로 이어져 단계적 감소를 지연시키고 주의 안정성을 유지함으로써 외삽 성능을 향상시킨다는 점을 입증한다. 또한, 큰 기저 값은 단계 래핑을 통해 효과적인 범위를 연장한다.

실험 결과

연구 질문

  • RQ110,000은 미세조정 시 RoPE 기반 외삽에 있어 가장 나쁜 기저 값인가? 그리고 이 값에서 성능 저하가 발생하는 이유는 무엇인가?
  • RQ2원형 기저, 미세조정 컨텍스트 길이, 외삽 상한 사이에 수학적 관계가 존재하는가?
  • RQ3더 작은 기저와 더 큰 기저 값이 모두 외삽 성능 향상에 기여할 수 있는가? 이 이중 방향성 향상의 이유는 무엇인가?
  • RQ4RoPE 외삽 문제의 근본 원인은 무엇이며, 주의 점수 안정성과 주기성과의 관계는 어떻게 되는가?
  • RQ5제안된 스케일링 법칙이 Dynamic NTK 및 Code LLaMA와 같은 기존 방법의 성공을 설명할 수 있는가?

주요 결과

  • 표준 10,000 기저 외에 더 작은 기저(예: 500) 또는 더 큰 기저(예: 1,000,000)를 사용해 원래의 4K 컨텍스트 길이에서 미세조정할 경우, 표준 10,000 기저보다 외삽 성능이 크게 향상된다.
  • LLaMA2 7B 및 13B 모델은 기저 값을 1,000,000으로 설정하고 16K 컨텍스트 길이에서만 미세조정함으로써 100만 토큰의 컨텍스트 길이까지 외삽을 달성한다.
  • 기저 값이 10,000일 때 성능 저하는 각도 해상도와 주기성 간의 임계적 불일치로 인한 것으로 기인하며, 이는 테스트 범위 내에서 가장 열 劣한 성능을 보이는 기저 값이다.
  • 기저 값 감소는 각도 해상도 향상으로 이어져 단계적 감소를 지연시키고 주의 안정성을 유지함으로써 외삽 성능을 향상시킨다.
  • 이 프레임워크는 Code LLaMA(100만 기저, 16K 미세조정)의 성공을 설명한다. 큰 기저 값과 긴 컨텍스트 길이의 조합이 장기간 시퀀스에서 안정적인 단계 진행을 가능하게 하기 때문이다.
  • 매우 큰 기저 값에 대해 외삽 성능의 상한선을 규명함으로써, RoPE의 단계 기반 일반화의 이론적 한계를 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.