[논문 리뷰] N-Grammer: Augmenting Transformers with latent n-grams
N-Grammer는 어텐션 헤드 출력의 제품 양자화를 통한 학습 가능한 이산 잠재 n-그램을 도입하여 트랜스포머의 성능을 저하시키지 않은 채 더 빠른 추론을 가능하게 한다. 이는 C4와 SuperGLUE에서 더 큰 트랜스포머와 Primer 모델을 능가하는 성능을 달성하면서도 고비용의 밀도 행렬 연산에 대한 의존도를 줄인다.
Transformer models have recently emerged as one of the foundational models in natural language processing, and as a byproduct, there is significant recent interest and investment in scaling these models. However, the training and inference costs of these large Transformer language models are prohibitive, thus necessitating more research in identifying more efficient variants. In this work, we propose a simple yet effective modification to the Transformer architecture inspired by the literature in statistical language modeling, by augmenting the model with n-grams that are constructed from a discrete latent representation of the text sequence. We evaluate our model, the N-Grammer on language modeling on the C4 data-set as well as text classification on the SuperGLUE data-set, and find that it outperforms several strong baselines such as the Transformer and the Primer. We open-source our model for reproducibility purposes in Jax.
연구 동기 및 목표
- 큰 트랜스포머 모델의 추론 비용을 성능 저하 없이 줄이는 것.
- 통계적 언어 모델링과 이산 잠재 표현에 영감을 받은 효율적인 아키텍처 수정을 탐색하는 것.
- 학습된 n-그램 구조를 통해 밀도 행렬 곱셈을 대체하는 희소 임베딩 룩업으로 인한 더 빠른 추론을 가능하게 하는 것.
- 표준 NLP 벤치마크인 C4와 SuperGLUE에서 잠재 n-그램의 효과를 평가하는 것.
제안 방법
- N-Grammer 레이어는 각 어텐션 헤드의 출력에 제품 양자화(PQ)를 적용하여 이산 잠재 코드를 생성한다.
- 연속된 잠재 코드들로부터 이중그램을 형성하고, 이를 학습 가능한 n-그램 임베딩으로 매핑하기 위해 룩업 테이블을 사용한다.
- 최종 표현은 원본 입력 임베딩과 n-그램 임베딩 사이의 잔차 연결(residual connection)이다.
- 모델은 표준 목표함수를 사용해 엔드 투 엔드로 훈련되며, 추론 시에는 n-그램 테이블을 캐시한다.
- 아키텍처는 고비용의 밀도 행렬 곱셈 대신 희소 임베딩 룩업을 사용하여 계산 비용을 감소시킨다.
- 토큰-클러스터 매핑을 캐시함으로써 효율적인 배포가 가능해지며, 추론 시 일정한 오버헤드를 유도한다.
실험 결과
연구 질문
- RQ1이산 표현에서 유도된 잠재 n-그램이 성능 저하 없이 트랜스포머의 효율성을 향상시킬 수 있는가?
- RQ2정확도와 추론 속도 측면에서 N-Grammer 레이어는 더 큰 트랜스포머와 Primer 모델에 비해 어떻게 비교되는가?
- RQ3학습된 잠재 클러스터가 의미적으로 관련된 그룹(예: 스포츠, 예술, 장소 등)을 어느 정도 잘 포괄하는가?
- RQ4희소 임베딩 룩업이 어텐션 메커니즘에서 밀도 연산을 대체하여 추론 지연을 줄일 수 있는가?
- RQ5어텐션 헤드에 대한 제품 양자화가 의미적으로 일관된 n-그램 표현을 이끌어내는가?
주요 결과
- N-Grammer 모델은 C4의 퍼플렉서티를 64.98로 달성하여 표준 트랜스포머(66.74)와 Primer(62.20)를 능가한다.
- SuperGLUE에서 N-Grammer 모델은 평균 점수 68.27을 기록하여 트랜스포머(65.38)와 Primer(63.46)를 초월한다.
- 8K개의 잠재 클러스터와 196K개의 n-그램 임베딩을 가진 모델는 더 큰 모델과 동일한 성능을 달성하면서도 추론 속도가 빠르게 된다.
- 클러스터 분석 결과, 잠재 코드들이 의미적으로 관련된 토큰들—예를 들어 스포츠, 예술, 장소—를 그룹화하고 있음을 확인하여 의미 있는 표현 학습이 이루어졌음을 보여준다.
- N-Grammer 레이어는 고비용의 밀도 행렬 곱셈을 희소 임베딩 룩업으로 대체함으로써 그 의존도를 줄였다.
- 토큰-클러스터 매핑을 캐시함으로써 추론 시 일정한 오버헤드를 유지할 수 있어, 희소 연산을 선호하는 하드웨어에서 매우 높은 배포 가능성 확보가 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.