[논문 리뷰] Your Transformer May Not be as Powerful as You Expect
이 논문은 표준 Relative Positional Encoding (RPE)-기반 트랜스포머가 소프트맥스 연산으로 인해 위치 정보를 포착하는 데 제한을 받기 때문에 일반 함수 근사기로 기능하지 못함을 밝혀낸다. 이를 해결하기 위해 저자들은 이론적 조건을 충족하고 다양한 작업에서 최고 성능을 내며 파라미터 효율성을 확보하는 Universal RPE 기반(URPE) 어텐션을 제안한다.
Relative Positional Encoding (RPE), which encodes the relative distance between any pair of tokens, is one of the most successful modifications to the original Transformer. As far as we know, theoretical understanding of the RPE-based Transformers is largely unexplored. In this work, we mathematically analyze the power of RPE-based Transformers regarding whether the model is capable of approximating any continuous sequence-to-sequence functions. One may naturally assume the answer is in the affirmative -- RPE-based Transformers are universal function approximators. However, we present a negative result by showing there exist continuous sequence-to-sequence functions that RPE-based Transformers cannot approximate no matter how deep and wide the neural network is. One key reason lies in that most RPEs are placed in the softmax attention that always generates a right stochastic matrix. This restricts the network from capturing positional information in the RPEs and limits its capacity. To overcome the problem and make the model more powerful, we first present sufficient conditions for RPE-based Transformers to achieve universal function approximation. With the theoretical guidance, we develop a novel attention module, called Universal RPE-based (URPE) Attention, which satisfies the conditions. Therefore, the corresponding URPE-based Transformers become universal function approximators. Extensive experiments covering typical architectures and tasks demonstrate that our model is parameter-efficient and can achieve superior performance to strong baselines in a wide range of applications. The code will be made publicly available at https://github.com/lsj2408/URPE.
연구 동기 및 목표
- RPE 기반 트랜스포머의 연속적인 시퀀스-투-시퀀스 함수 근사 능력에 대한 이론적 표현력을 조사한다.
- 깊이와 넓이가 널리 사용되는 RPE 기반 트랜스포머가 특정 함수를 일반적으로 근사하지 못하는 이유를 규명한다.
- RPE 기반 모델에서 일반 함수 근사를 가능하게 하는 충분한 이론적 조건—즉, 어텐션 기반 조건과 위치 인식 조건—을 도출한다.
- 이러한 조건을 충족하고 모델 용량을 향상시키는 새로운 어텐션 메커니즘인 URPE 기반 어텐션을 설계한다.
- 다양한 아키텍처와 작업에서 URPE 기반 트랜스포머의 우수성을 경험적으로 검증한다.
제안 방법
- 이론적 분석을 통해 표준 RPE 어텐션의 소프트맥스 연산이 오른쪽 스토케스틱 행렬을 생성함을 규명하여, RPE로부터 위치 정보를 포착하는 능력이 제한됨을 밝혀낸다.
- RPE 기반 트랜스포머가 일반 함수 근사를 달성하기 위해 필요한 두 가지 충분한 조건—어텐션 기반 조건과 위치 인식 조건—을 유도한다.
- 오른쪽 스토케스틱 행렬 제약 조건을 깨뜨림으로써 이러한 조건을 충족시키는 새로운 어텐션 모듈인 Universal RPE 기반(URPE) 어텐션을 설계한다.
- URPE 어텐션은 표준 트랜스포머 아키텍처, 특히 NLP 및 그래프 학습용 아키텍처에 통합되며, 최소한의 파라미터 오버헤드를 유발한다.
- 표준 벤치마크인 OGB-LSC와 GLUE를 사용하여 합성 작업, 언어 모델링, 그래프 노드 분류에서 방법을 평가한다.
- 공정한 비교를 위해 하이퍼파ram터를 최적화하며, 여러 개의 GPU를 사용해 Adam 옵timizer와 선형 학습률 감소 전략을 적용해 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1RPE 기반 트랜스포머는 어떤 연속적인 시퀀스-투-시퀀스 함수라도 일반적으로 근사할 수 있는가?
- RQ2깊이와 넓이가 널리 사용되는 표준 RPE 기반 트랜스포머가 일반 근사를 달성하지 못하는 이유는 무엇인가?
- RQ3RPE 기반 트랜스포머가 일반 함수 근사기로 기능하기 위해 필요한 이론적 조건은 무엇인가?
- RQ4이러한 조건을 충족시키고 모델 표현력을 향상시킬 수 있는 새로운 어텐션 메커니즘을 설계할 수 있는가?
- RQ5제안된 URPE 기반 트랜스포머는 다양한 작업과 아키텍처에서 일관된 성능 향상을 달성하는가?
주요 결과
- 표준 RPE 기반 트랜스포머는 소프트맥스 연산으로 인해 RPE에 코딩된 위치 정보를 활용하는 능력이 제한되어 일반 함수 근사기로 기능하지 못한다.
- 제안된 URPE 기반 어텐션은 필수적인 이론적 조건을 충족시키며 RPE 기반 트랜스포머에서 일반 근사를 가능하게 한다.
- MAG240M 그래프 데이터셋에서 URPE 기반 Graphormer는 검증 정확도 0.7074를 기록하여 원본 Graphormer보다 0.06 향상되었고, 단일 모델 기준으로는 최고 성능을 기록했다.
- 언어 사전 훈련에서 URPE 기반 트랜스포머는 마스킹된 언어 모델링 손실 1.87을 기록하여 RPE 전용 모델(1.94)을 초월하고 APE와 RPE를 모두 사용하는 모델(1.86)과 동등한 성능을 보였다.
- 합성 작업, NLP, 그래프 학습 전반에서 URPE 기반 모델은 일관된 성능 향상을 보이며 파라미터 효율성과 광범위한 적용 가능성을 입증했다.
- 이론적 분석과 합성 실험을 통해 소프트맥스에 의해 유도되는 오른쪽 스토케스틱 행렬 제약 조건은 표준 RPE 기반 어텐션의 근본적인 병목 요소임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.