[논문 리뷰] Transformer Language Models without Positional Encodings Still Learn Positional Information
이 논문은 인과적 어텐션 메커니즘을 통해 명시적인 위치 인코딩 없이도 인과적 트랜스포머 언어 모델이 암묵적인 절대적 위치 정보를 학습함을 보여주며, 다양한 모델 크기, 데이터셋 및 시퀀스 길이에서 경쟁 가능한 성능을 달성한다. 저자들은 인과적 마스크가 어휘 위치를 계산하는 데 도움이 되어, 위치 인코딩이 없는 상황에서 NoPos 모델이 양방향 모델보다 우수한 성능을 내는 이유를 설명한다.
Causal transformer language models (LMs), such as GPT-3, typically require some form of positional encoding, such as positional embeddings. However, we show that LMs without any explicit positional encoding are still competitive with standard models, and that this phenomenon is robust across different datasets, model sizes, and sequence lengths. Probing experiments reveal that such models acquire an implicit notion of absolute positions throughout the network, effectively compensating for the missing information. We conjecture that causal attention enables the model to infer the number of predecessors that each token can attend to, thereby approximating its absolute position. Our findings indicate that causal LMs might derive positional awareness not only from the explicit positioning mechanism, but also from the effects of the causal mask.
연구 동기 및 목표
- 트랜스포머 언어 모델이 명시적인 위치 인코딩 없이도 위치 정보를 학습할 수 있는지 조사하기 위해.
- 다양한 모델 크기, 데이터셋 및 시퀀스 길이에서 NoPos 모델의 강건성 평가하기 위해.
- NoPos 모델의 히든 표현에서 암묵적인 위치 인식이 나타나는지 분석하기 위해.
- 인과적 어텐션 메커니즘이 암묵적인 위치 학습의 원인인지 규명하기 위해.
- 명시적인 위치 인코딩이 없는 상황에서 자동회귀(인과적) 모델과 양방향(마스크된) 모델의 행동을 비교하기 위해.
제안 방법
- 모든 위치 인코딩 없이 훈련된 트랜스포머 언어 모델(NoPos)을 학습하고, 사인파, 학습 가능한, ALiBi 위치 인코딩이 있는 모델들과 비교하였다.
- 다양한 네트워크 레이어에서 히든 표현으로부터 토큰 위치를 예측하는 프로빙 분류기 사용하였다.
- WikiText-103 및 대규모 Pile 코퍼스 개요에서 검증 세트의 엔트로피를 측정하여 성능을 평가하였다.
- 마스크된 언어 모델(MLM)에 대한 분석을 통해 이중방향 어텐션도 명시적인 인코딩 없이 위치를 학습할 수 있는지 테스트하였다.
- 인과적 마스크가 이전 토큰 수를 추론하는 데 도움이 되는지 확인하기 위해 어텐션 패턴을 분석하였다.
- 다양한 모델 크기(125M에서 1.3B 파라미터) 및 시퀀스 길이(최대 512 토큰)에서 모델 행동을 평가하였다.
실험 결과
연구 질문
- RQ1트랜스포머 언어 모델은 명시적인 위치 인코딩 없이도 절대적 위치 정보를 학습할 수 있는가?
- RQ2인과적 어텐션 메커니즘이 자동회귀 모델에서 암묵적인 위치 학습을 가능하게 하는가?
- RQ3다양한 데이터셋과 모델 크기에서 NoPos 모델의 성능은 위치 인식 모델과 어떻게 비교되는가?
- RQ4왜 이중방향 마스크된 언어 모델은 명시적인 위치 인코딩 없이도 위치를 학습하지 못하는가?
- RQ5NoPos 모델의 히든 표현은 토큰의 진짜 위치를 어느 정도 정확하게 예측할 수 있는가?
주요 결과
- NoPos 모델은 다양한 데이터셋과 모델 크기에서 학습 가능한, 사인파, 또는 ALiBi 위치 인코딩을 사용한 모델들과 비교해도 경쟁 가능한 엔트로피 점수를 기록한다.
- 프로빙 실험 결과, NoPos 모델은 의미 있는 절대 위치 표현을 학습하며, 평균 절대 예측 오차가 학습 가능한 위치 임베딩을 사용한 모델들과 유사하다.
- 인과적 어텐션 마스크는 모델이 이전 토큰의 수를 암묵적으로 추론할 수 있도록 하여, 사실상 절대 위치를 근사한다.
- 이중방향 마스크된 언어 모델은 위치 인코딩 없이 훈련할 경우 수렴하지 못하며, 이는 인과적 어텐션이 암묵적 위치 학습에 필수적임을 시사한다.
- 모델 크가 커질수록 NoPos 모델과 위치 인식 모델 간의 성능 격차가 줄어들며, 이는 더 큰 모델이 명시적인 위치 인식 유도 편향에 더 적게 의존할 수 있음을 시사한다.
- Pile 코퍼스에서 훈련된 NoPos 모델은 검증 엔트로피 17.8을 기록했으며, 최고의 베이스라인 모델(17.6)과 거의 동일한 성능을 보였다. 이는 명시적인 위치 인코딩 없이도 근사 동등한 성능을 달성했음을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.