Skip to main content
QUICK REVIEW

[논문 리뷰] KERPLE: Kernelized Relative Positional Embedding for Length Extrapolation

Ta-Chung Chi, Ting-Han Fan|arXiv (Cornell University)|2022. 05. 20.
Topic Modeling인용 수 9
한 줄 요약

KERPLE는 조건부 정부호정의(conditional positive definite, CPD) 커널을 활용하여 소프트맥스 정규화 과정에서 흡수되는 일정한 오프셋을 통해 CPD 커널을 정부호정의(positive definite, PD) 커널로 변환함으로써 트랜스포머에서 길이 외삽을 가능하게 하는 커널화된 상대적 위치 임베딩 프레임워크를 제안한다. 이 방법은 OpenWebText2, GitHub, ArXix와 같은 대규모 언어 모델링 데이터셋에서 최신 기술 수준의 외삽 성능을 달성하며, 특히 로그 커널 변형에서 뛰어난 성능을 보인다.

ABSTRACT

Relative positional embeddings (RPE) have received considerable attention since RPEs effectively model the relative distance among tokens and enable length extrapolation. We propose KERPLE, a framework that generalizes relative position embedding for extrapolation by kernelizing positional differences. We achieve this goal using conditionally positive definite (CPD) kernels, a class of functions known for generalizing distance metrics. To maintain the inner product interpretation of self-attention, we show that a CPD kernel can be transformed into a PD kernel by adding a constant offset. This offset is implicitly absorbed in the Softmax normalization during self-attention. The diversity of CPD kernels allows us to derive various RPEs that enable length extrapolation in a principled way. Experiments demonstrate that the logarithmic variant achieves excellent extrapolation performance on three large language modeling datasets. Our implementation and pretrained checkpoints are released at https://github.com/chijames/KERPLE.git.

연구 동기 및 목표

  • 모델의 훈련 길이 L을 초월하는 시퀀스 길이로 일반화할 수 있도록 해야 한다는 트랜스포머 모델의 길이 외삽 문제를 해결하기 위해.
  • 기존의 상대적 위치 임베딩(RPE)이 훈련 길이를 초월할 경우 일반화 성능이 떨어지는 한계를 극복하기 위해.
  • 조건부 정부호정의(CPD) 커널의 수학적 성질을 활용하여 외삽을 지원하는 체계적인 RPE 설계 프레임워크를 개발하기 위해.
  • 학습 가능한 CPD 커널이 데이터세트에 특화된 장거리 종속성에 적응할 수 있음을 입증하여 ALiBi와 같은 고정 파rameter 방법보다 뛰어난 성능을 내는지 확인하기 위해.
  • 기존의 방법들인 ALiBi 등을 일반화하고, 강력한 외삽 능력을 지닌 RPE를 체계적으로 탐색할 수 있는 통합 프레임워크를 제공하기 위해.

제안 방법

  • 조건부 정부호정의(CPD) 커널을 사용하여 상대적 위치 차이를 커널화함으로써, 이는 거리 척도를 일반화하고 외삽을 가능하게 한다.
  • 일정한 오프셋을 더하여 CPD 커널을 정부호정의(PD) 커널로 변환하며, 이 오프셋은 자기주의 어텐션의 소프트맥스 정규화 과정에서 암묵적으로 흡수된다.
  • 어텐션 헤드 전반에 걸쳐 커널 함수의 학습 가능한 파arameterization을 사용하여 데이터세트에 특화된 장거리 종속성에 적응할 수 있도록 한다.
  • 프레임워크는 인과적 언어 모델링에 적용되며, 어텐션 점수는 쿼리-키 내적 곱과 커널화된 상대적 위치 편향의 합으로 계산된다.
  • 추론 시 더 긴 시퀀스에서 먼 토큰에 대한 어텐션을 유지하기 위해 커널 함수가 느리게 감쇠하도록 설계된다(예: 로그 함수).
  • 실험은 공정한 비교를 위해 GPT-NeoX 코드베이스를 사용하며, 짧은 시퀀스(길이 3)에서 훈련하고, 길이 16384까지의 긴 시퀀스에서 평가한다.

실험 결과

연구 질문

  • RQ1조건부 정부호정의(CPD) 커널을 사용하여 트랜스포머에서 길이 외삽을 지원하는 상대적 위치 임베딩을 설계할 수 있는가?
  • RQ2커널 함수의 선택(예: 로그 함수 대비 거듭제곱 법칙)이 추론 시 장거리 종속성에 대한 어텐션 능력에 어떤 영향을 미치는가?
  • RQ3커널 함수 내 학습 가능한 파aram터가 ALiBi와 같은 고정 파aram터 방법보다 데이터세트에 특화된 장거리 종속성에 더 잘 적응할 수 있는가?
  • RQ4커널화된 RPE 프레임워크가 ALiBi와 같은 기존 방법들을 얼마나 잘 일반화하는가?
  • RQ5커널의 감쇠 속도에 의해 정의되는 어텐션의 유효 길이와 장거리 작업에서의 모델 성능 간의 상관관계는 어떠한가?

주요 결과

  • KERPLE의 로그 함수 변형은 OpenWebText2, GitHub, ArXiv의 세 가지 대규모 언어 모델링 데이터셋에서 가장 뛰어난 길이 외삽 성능을 기록한다.
  • KERPLE-log는 시퀀스 길이 16384에서도 낮은 퍼플렉서티를 유지하며, 창문 어텐션(window@512)과 ALiBi보다 높은 퍼플렉서티를 보이는 것을 초월한다.
  • KERPLE-log로 훈련된 모델는 먼 토큰에 대한 어텐션 감쇠가 느리게 나타나, 더 강력한 장거리 종속성 모델링 능력을 보인다.
  • 커널 편향이 -2 이하로 떨어지는 거리로 정의되는 어텐션의 유효 길이가 로그 함수 커널의 경우 거듭제곱 법칙 변형보다 현저히 길다.
  • 유효 길이 ≤ |m−n|인 헤드의 누적 수를 고려할 때, KERPLE-log는 다른 방법들보다 더 넓은 거리 범위에서 먼 토큰에 대한 어텐션을 유지한다.
  • 이 방법은 ALiBi를 특수한 경우로 일반화하며, ALiBi의 경우 고정 파aram터를 가진 선형 CPD 커널에 해당하지만, KERPLE는 학습 가능한, 데이터세트에 적응 가능한 파aram터를 허용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.