[논문 리뷰] Improve Transformer Models with Better Relative Position Embeddings
이 논문은 자기주도 어텐션에서 쿼리, 키, 상대적 위치 임베딩 간의 상호작용을 증가시켜 트랜스포저의 성능을 향상시키는 일반화된 상대적 위치 임베딩 방법을 제안한다. 기존의 절대적 및 상대적 위치 방법보다 SQuAD1.1 성능을 향상시키며, 최소한의 계산 비용으로 BERT-large의 F1 점수를 93.15%에서 93.55%로 높이는 거의 즉시 교체가 가능한 방법을 제공한다.
Transformer architectures rely on explicit position encodings in order to preserve a notion of word order. In this paper, we argue that existing work does not fully utilize position information. For example, the initial proposal of a sinusoid embedding is fixed and not learnable. In this paper, we first review absolute position embeddings and existing methods for relative position embeddings. We then propose new techniques that encourage increased interaction between query, key and relative position embeddings in the self-attention mechanism. Our most promising approach is a generalization of the absolute position embedding, improving results on SQuAD1.1 compared to previous position embeddings approaches. In addition, we address the inductive property of whether a position embedding can be robust enough to handle long sequences. We demonstrate empirically that our relative position embedding method is reasonably generalized and robust from the inductive perspective. Finally, we show that our proposed method can be adopted as a near drop-in replacement for improving the accuracy of large models with a small computational budget.
연구 동기 및 목표
- 기존 트랜스포저 모델에서 상대적 위치 정보가 제대로 활용되지 않는 문제를 해결하기 위해.
- 인덕티브 관점에서 더 긴 시퀀스에 대한 일반화 능력과 강건성을 향상시키기 위해.
- 대용량 모델의 정확도를 낮은 계산 비용으로 향상시킬 수 있는 거의 즉시 교체가 가능한 상대적 위치 임베딩을 개발하기 위해.
- 다양한 시퀀스 길이와 커파이팅 임계값 조건 하에서 상대적 위치 임베딩의 강건성을 경험적으로 검증하기 위해.
제안 방법
- 자기주도 어텐션 메커니즘에서 쿼리, 키, 상대적 위치 임베딩 간의 상호작용을 향상시키는 일반화된 상대적 위치 임베딩을 제안한다.
- 절대적 위치 임베딩을 일반화하고 어텐션 동역학을 향상시키기 위해 학습 가능한 상대적 위치 임베딩을 도입한다.
- 상대적 위치 임베딩을 쿼리 및 키 계산에 명시적으로 통합한 수정된 자기주도 어텐션 메커니즘을 사용한다.
- 효율성과 일반화를 향상시키기 위해 하이퍼파라미터 $k$를 사용하는 커파이팅 메커니즘을 적용한다.
- BERT-large에 대해 즉시 교체 방식으로 적용하여, 오직 3 에포크와 작은 학습률로 미세조정한다.
- 모델 행동 분석과 국소화된 어텐션 행동을 확인하기 위해 어텐션 패턴과 임베딩 가중치를 시각화한다.
실험 결과
연구 질문
- RQ1쿼리 및 키와 더 잘 상호작용하는 상대적 위치 임베딩을 설계할 수 있는가, 이는 어텐션 성능 향상으로 이어지는가?
- RQ2제안된 상대적 위치 임베딩은 사전학습 길이를 초월해 더 긴 시퀀스에 대해 강건하게 일반화되는가?
- RQ3이 방법은 대용량 사전학습 모델의 성능을 최소한의 계산 비용으로 효과적으로 향상시킬 수 있는가?
- RQ4커파이팅 임계값 $k$는 다양한 시퀀스 길이에서 모델 성능과 일반화에 어떤 영향을 미치는가?
주요 결과
- 제안된 방법(방법 4)은 SQuAD1.1 F1 점수 93.55%를 기록하여 기준 BERT-large 모델의 93.15%를 초월한다.
- SQuAD 데이터에서 최대 시퀀스 길이를 늘린 미세조정(최대 704) 시, 576 토큰까지의 시퀀스에서 F1 점수가 최고 수준인 90.71%를 기록한다.
- 모델은 더 긴 시퀀스에 대해 강건성을 보이며, 576, 640, 704 토큰의 미세조정 길이에서 성능이 안정적이다.
- 시각화 결과 어텐션은 매우 국소화되어 있으며, 가까운 토큰에 강한 어텐션을 보이고 먼 토큰에는 거의 0에 가까운 어텐션을 보여, 작은 $k$의 사용이 타당함을 입증한다.
- 오직 3개의 미세조정 에포크와 무시할 만한 파rameter 증가 또는 추론 지연 증가로 BERT-large에서 F1 점수를 0.4% 향상시킨다.
- 사전학습과 미세조정 시퀀스 길이가 다를 경우에도 상대적 위치 임베딩이 효과가 있음을 입증하여 강력한 인덕티브 일반화 능력을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.