[논문 리뷰] A Length-Extrapolatable Transformer
이 논문은 긴 문맥을 다룰 수 있도록 설계된 LeX Transformer를 제안한다. 이는 새로운 상대적 위치 임베딩(xPos)과 블록 단위의 인과적 어텐션을 통해 장문의 문맥을 다룰 수 있도록 하는 길이 외삽 가능(few-shot) 어텐션 메커니즘을 제공한다. 어텐션 해상도를 극대화하고 훈련 시 본 길이를 초월한 시퀀스에서도 안정적인 성능을 유지함으로써, 내삽과 외삽 모두에서 뛰어난 성능을 달성하며, 기존 방법들보다 장문의 언어 모델링 작업에서 슈퍼리어한 성능을 보인다.
Position modeling plays a critical role in Transformers. In this paper, we focus on length extrapolation, i.e., training on short texts while evaluating longer sequences. We define attention resolution as an indicator of extrapolation. Then we propose two designs to improve the above metric of Transformers. Specifically, we introduce a relative position embedding to explicitly maximize attention resolution. Moreover, we use blockwise causal attention during inference for better resolution. We evaluate different Transformer variants with language modeling. Experimental results show that our model achieves strong performance in both interpolation and extrapolation settings. The code will be available at https://aka.ms/LeX-Transformer.
연구 동기 및 목표
- 훈련 중에 관찰한 길이를 초월한 시퀀스 길이로 일반화하는 데에 어려움을 겪는 트랜스포머의 핵심적 한계를 해결하기 위해.
- 모델이 더 긴 시퀀스로 외삽할 수 있는 능력을 수량화하는 데 사용할 수 있는 메트릭인 어텐션 해상도를 정의하고 최적화하기 위해.
- 장기간의 맥락에서 고해상도와 안정성을 유지할 수 있도록 개선된 RoPE와 Alibi를 초월하는 상대적 위치 임베딩(xPos)을 설계하기 위해.
- 재학습 없이도 짧은 맥락 성능을 희생시키지 않고 긴 시퀀스에서 뛰어난 성능을 달성할 수 있도록 하기 위해.
- 블록 단위의 인과적 어텐션이 자동회귀 언어 모델링에서 해상도를 향상시키고 외삽을 지원하는지 입증하기 위해.
제안 방법
- RoPE에서 유도된 상대적 위치 임베딩인 xPos를 제안하며, 이는 회전 행렬에 지수 감쇠를 도입하여 어텐션 해상도를 향상시키기 위해 일반화된 형태로 설계된다.
- 어느 모델이 장기간의 시퀀스에서 위치 차이를 얼마나 잘 유지하는지 측정하기 위해 어텐션 해상도를 정량적 메트릭으로 정의한다.
- 추론 중에 블록 단위의 인과적 어텐션(BCA)을 도입하여 지역 블록에만 어텐션을 제한함으로써 해상도를 향상시키고, 同시에 장거리 의존성 모델링을 유지한다.
- 쿼리-키 상호작용을 xPos 임베딩으로 조정함으로써 상대적 위치를 고정밀도로 인코딩할 수 있도록 수정된 자기어텐션 메커니즘을 사용한다.
- 순서 불변성과 이동 불변성을 보장하는 통합 설계 원칙을 적용하여 입력 길이의 변동에 대해 강건한 성능을 확보한다.
- 표준 밀도 어텐션을 사용해 훈련을 처음부터 수행함으로써, 표준 길이 입력에서의 효율성과 성능을 유지한다.
실험 결과
연구 질문
- RQ1극히 긴 시퀀스에서 고해상도 어텐션 성능을 유지할 수 있도록 설계된 상대적 위치 임베딩을 개발할 수 있는가? 이는 훈련 길이를 초월한 외삽을 가능하게 할 수 있는가?
- RQ2블록 단위의 인과적 어텐션은 장문의 언어 모델링에서 어텐션 해상도와 성능에 어떤 영향을 미치는가?
- RQ3제안된 xPos 임베딩은 짧은 맥락과 긴 맥락 설정 모두에서 RoPE와 Alibi를 초월하는가?
- RQ4재학습 없이도 또는 아키텍처 변경 없이도 짧은 시퀀스에서 훈련된 모델이 매우 긴 시퀀스로 효과적으로 일반화할 수 있는가?
- RQ5제안된 방법에서 향상된 외삽 성능와 인프라 비용 증가 사이의 상충 관계는 어떠한가?
주요 결과
- LeX Transformer는 사전 훈련 중 검증 세트에서 최소 퍼플렉서티를 달성하여 분포 내 성능이 뛰어나다는 것을 보여준다.
- arXiv 데이터셋(평균 길이 >6k)에서 LeX Transformer는 시퀀스 길이가 증가함에 따라 퍼플렉서티가 계속 감소하는 반면, 다른 모델들은 포화 상태에 도달하거나 퍼플렉서티가 증가한다.
- 블록 단위의 인과적 어텐션 없이 동일한 모델을 사용할 경우 xPos는 2048 토큰에서 약 1, 4096 토큰에서 약 8의 퍼플렉서티 감소를 유도한다.
- 블록 단위의 인과적 어텐션은 RoPE 기반 모델이 장기간에 걸쳐 퍼플렉서티 폭발을 방지하기 위해 필수적이지만, Alibi의 경우 이미 내재된 부드러운 어텐션 창이 있기 때문에 덜 중요하다.
- 모델는 표준 길이 시퀀스에서도 뛰어난 성능을 유지하며, 짧은 맥락과 긴 맥락 능력 간의 상충관계가 없다.
- xPos는 절대 위치 임베딩 대비 약 6%의 추가 인프라 비용만을 유발하며, 훈련 수렴 속도가 빠르다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.