[논문 리뷰] Pay Attention when Required
이 논문은 WikiText-103에서 최신 퍼플렉서티를 유지하면서도 자기주의 블록을 63% 감소시킨 더 효율적인 Transformer 아키텍처인 PAR Transformer를 제안한다. 미분 가능 신경망 아키텍처 탐색을 통해 자기주의가 첫 번째 두 번째 층에서만 필요한 것으로 규명되었으며, 이는 다양한 데이터셋과 모델(예: BERT 포함)에서 정확도 저하 없이 35% 높은 추론 지연 시간을 달성한다.
Transformer-based models consist of interleaved feed-forward blocks - that capture content meaning, and relatively more expensive self-attention blocks - that capture context meaning. In this paper, we explored trade-offs and ordering of the blocks to improve upon the current Transformer architecture and proposed PAR Transformer. It needs 35% lower compute time than Transformer-XL achieved by replacing ~63% of the self-attention blocks with feed-forward blocks, and retains the perplexity on WikiText-103 language modelling benchmark. We further validated our results on text8 and enwiki8 datasets, as well as on the BERT model.
연구 동기 및 목표
- 자기주의와 피드포워드 블록의 배치 및 비율을 재고함으로써 Transformer 아키텍처를 최적화하는 것.
- 성능 저하 없이 대규모 언어 모델의 계산 비용과 추론 지연 시간을 줄이는 것.
- 블록 순서와 조합에 중점을 두고 자동 탐색을 통해 최적의 아키텍처 패턴을 규명하는 것.
- 다양한 데이터셋(WikiText-103, enwiki8, text8)과 모델 유형(BERT, Transformer-XL) 간 일반화 가능성 검증.
- 미분 가능 신경망 아키텍처 탐색을 활용한 설명 가능하고 자동화된 효율적 Transformer 가족 설계 방법 제공.
제안 방법
- 세 가지 블록 유형(자기주의, 피드포워드, 아이덴티티)으로 구성된 검색 공간을 가진 미분 가능 신경망 아키텍처 탐색(NAS)을 적용.
- 각 레이어가 세 가지 블록 유형의 미분 가능 가중 조합인 슈퍼넷을 구축하였으며, 훈련 중에 Gumbel-Softmax를 사용해 샘플링.
- 정확도와 효율성을 동시에 최적화하는 단일 슈퍼넷을 훈련시켜 3^32가지 가능한 아키텍처에 대해 선형 복잡도의 검색을 가능하게 함.
- 학습된 주의 확률을 바탕으로 설계 규칙 유도: 자기주의는 첫 번째 두 번째 층에서만 필요하며, 자기주의 대 피드포워드 블록 비율(p:1, p=5)이 최적임.
- 유도된 규칙을 적용해 주의 블록 수를 줄였지만 성능을 유지하는 PAR Transformer 및 PAR BERT 모델 생성.
- 표준 하이퍼파라미터와 추론 설정을 사용하여 다양한 벤치마크(WikiText-103, enwiki8, text8)와 작업(언어 모델링, QA, 감성 분석)에서 결과 검증.
실험 결과
연구 질문
- RQ1Transformer 인코더에서 자기주의와 피드포워드 블록의 최적 순서와 비율은 무엇인가?
- RQ2추가적인 자기주의 블록이 성능 향상에 대해 점점 더 미미한 기여를 하는 시점은 언제인가?
- RQ3감소된 수의 자기주의 블록으로도 정확도를 유지하면서 추론 비용을 크게 낮출 수 있는가?
- RQ4최적 아키텍처 패턴은 다양한 데이터셋과 모델 아키텍처(BERT, Transformer-XL 등) 간 일반화 가능한가?
- RQ5미분 가능 NAS를 활용해 설명 가능하고 효율적인 Transformer 아키텍처 설계 규칙를 도출할 수 있는가?
주요 결과
- PAR Transformer는 Transformer-XL 대비 자기주의 블록을 63% 감소시켜 WikiText-103에서 동일한 퍼플렉서티를 달성하면서도 추론 지연 시간을 35% 낮춘다.
- 최적 아키텍처는 자기주의를 첫 번째 두 번째 층에서만 사용하며, 피드포워드 대 자기주의 블록 비율 5:1이 최적임.
- WikiText-103 데이터셋에서 PAR Transformer Base는 Transformer-XL Base와 동일한 테스트 퍼플렉서티를 유지하면서 지연 시간을 0.65배로 줄였다.
- PAR 설계 규칙는 다른 데이터셋으로 일반화 가능: enwiki8 및 text8에서 감소된 계산 자원으로도 유사한 성능 달성.
- PAR BERT Base는 자기주의 블록 수를 절반으로 줄였음에도 불구하고 사전학습 손실과 MRPC/SST-2 피지컬 트레이닝에서 BERT Base와 동일한 성능를 보였으며, SQuAD v1.1에서 1% 정확도 저하가 있었음.
- PAR BERT는 더 많은 레이어를 사용하고 더 단순한 학습 프레임워크를 적용함에도 불구하고 DistilBERT와 유사한 지연 시간을 달성하여, 정제 없이도 아키텍처 효율성이 가능함을 시사함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.