[논문 리뷰] DeLighT: Deep and Light-weight Transformer
DeLighT은 매개변수 효율이 높은 딥 트랜스포머로, DeLighT 변환과 그룹 선형 변환 및 블록 단위 스케일링을 사용하여 표준 트랜스포머와 비슷하거나 더 나은 성능을 훨씬 적은 매개변수와 연산으로 달성합니다.
We introduce a deep and light-weight transformer, DeLighT, that delivers similar or better performance than standard transformer-based models with significantly fewer parameters. DeLighT more efficiently allocates parameters both (1) within each Transformer block using the DeLighT transformation, a deep and light-weight transformation, and (2) across blocks using block-wise scaling, which allows for shallower and narrower DeLighT blocks near the input and wider and deeper DeLighT blocks near the output. Overall, DeLighT networks are 2.5 to 4 times deeper than standard transformer models and yet have fewer parameters and operations. Experiments on benchmark machine translation and language modeling tasks show that DeLighT matches or improves the performance of baseline Transformers with 2 to 3 times fewer parameters on average. Our source code is available at: \url{https://github.com/sacmehta/delight}
연구 동기 및 목표
- 매개변수 비용에 비례하지 않게 깊이와 폭이 확장될 수 있는 매개변수 효율적 시퀀스 모델을 제안한다.
- 효율적으로 더 넓은 표현을 학습하기 위해 특잇한 DeLighT 변환과 특징 셔플링이 포함된 그룹 선형 변환을 제안한다.
- 출력에 가까운 더 깊고 넓은 블록에 더 많은 용량을 할당하고 입력 블록은 얕고 좁게 유지하는 블록 단위 스케일링을 도입한다.
- DeLighT가 번역 및 언어 모델링에서 기본 모델 대비 매개변수와 FLOPs를 크게 줄이면서 유사하거나 더 나은 성능을 달성한다는 것을 입증한다.
제안 방법
- N GLT 층을 사용해 dm-차원의 입력을 고차원 공간으로 확장한 다음 차원을 줄인다.
- 멀티헤드 어텐션과 FFN을 트랜스포머에서 단일-헤드 어텐션과 경량 FFN으로 대체한다.
- GLT 그룹 간 정보 공유를 위해 피처 셔플링을 사용하고 학습 안정화를 위해 입력 믹서를 사용한다.
- 입력 크기에서 깊이와 너비를 분리해, 초기 블록은 얕고 좁고 후반 블록은 더 깊고 넓은 블록이 되도록 블록 단위 스케일링을 가능하게 한다.
- Nmin, Nmax 및 wm으로 블록 단위 스케일링을 정의해 네트워크 전반에 걸쳐 다양한 깊이와 너비의 DeLighT 블록을 생성한다.
- do = dm/2가 주의 비용을 약 2배 정도 감소시키고, 경량 설계로 FFN은 대략 16배 감소한다는 것을 보여준다.
실험 결과
연구 질문
- RQ1입력 크기에서 폭/깊이가 분리된 깊고 가벼운 트랜스포머가 매개변수를 크게 줄이면서 트랜스포머 기저모델과 대등하거나 능가할 수 있는가?
- RQ2블록 단위 스케일링과 DeLighT 변환이 균등 스케일링에 비해 매개변수 활용도와 번역 및 언어 모델링 작업의 성과를 향상시키는가?
- RQ3BLEU와 perplexity 측면에서 DeLighT가 매개변수와 FLOPs가 더 적은 상황에서 최첨단 트랜스포머와 어떻게 비교되는가?
주요 결과
- DeLighT는 WMT 및 IWSLT 데이터셋에서 번역 기준 Transformer보다 BLEU 점수가 비슷하거나 더 좋고 매개변수는 2.8배에서 1.8배 더 적다.
- DeLighT는 표준 트랜스포머보다 2.5–4배 더 깊지만 매개변수와 연산은 더 적게 사용한다.
- WMT’14 En-Fr에서 DeLighT는 Transformer 기준보다 매개변수 130만 개 감소, 연산 30억 감소로 +1.3 BLEU를 달성한다.
- 언어 모델링(WikiText-103)에서 DeLighT는 Transformer-XL 성능과 비슷하면서 매개변수는 1.5배 더 적다.
- 블록 단위 스케일링은 입력에 가까운 매개변수를 적게 하고 출력 근처에 더 깊은 용량을 두어 효율성을 개선하되 성능 저하 없이.
- 정규화 필요성이 기본 Transformer 대비 줄어들어, 변환 자체에서 더 강한 표현력을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.