[논문 리뷰] Scalable Transformers for Neural Machine Translation
이 논문은 공유 가능하고 잘라낼 수 있는 가중치를 통해 다양한 FLOPs와 파라미터 수에 걸쳐 동적 스케일링을 가능하게 하는 단일 통합 모델인 확장 가능한 트랜스포머(Scalable Transformers, ST)를 제안한다. 온라인 어절 수준 및 오프라인 시퀀스 수준의 자기 정규화 기반의 삼단계 훈련 방식을 통해 ST는 재훈련 없이 다양한 모델 크기에서 최신 기술 성능을 달성하며, 하위 모델은 독립적으로 훈련된 대응 모델을 능가하고 일부 경우에서는 원래 가장 넓은 트랜스포머를 초월한다.
Transformer has been widely adopted in Neural Machine Translation (NMT) because of its large capacity and parallel training of sequence generation. However, the deployment of Transformer is challenging because different scenarios require models of different complexities and scales. Naively training multiple Transformers is redundant in terms of both computation and memory. In this paper, we propose a novel Scalable Transformers, which naturally contains sub-Transformers of different scales and have shared parameters. Each sub-Transformer can be easily obtained by cropping the parameters of the largest Transformer. A three-stage training scheme is proposed to tackle the difficulty of training the Scalable Transformers, which introduces additional supervisions from word-level and sequence-level self-distillation. Extensive experiments were conducted on WMT EN-De and En-Fr to validate our proposed Scalable Transformers.
연구 동기 및 목표
- 모바일 디바이스(낮은 FLOPs)에서부터 클러스터(높은 정확도)에 이르기까지 다양한 하드웨어 제약 조건을 고려해 재훈련 없이 트랜스포머를 배포하는 데 도전하는 것.
- 다양한 스케일에 맞는 별도의 모델을 재훈련하고 저장하는 데 발생하는 부정확한 중복을 제거하는 것.
- 유연하고 실시간으로 모델 너비를 스케일링할 수 있는 통합 아키텍처를 개발하여 번역 정확도를 유지하는 것.
- 공유된 파라미터를 사용해 서로 다른 크기의 하위 트랜스포머 간의 훈련 간섭을 지식 정규화 기법을 통해 완화하는 것.
제안 방법
- 모든 하위 트랜스포머가 가장 넓은 모델의 레이어를 잘라내어 얻을 수 있도록 공유된 파라미터를 가진 통합 확장 가능한 트랜스포머 아키텍처를 제안한다.
- 삼단계 훈련 방식을 적용: 먼저 가장 넓은 모델을 사전 훈련한 후, 훈련 중에 더 작은 하위 트랜스포머를 온라인 어절 수준 자기 정규화 기반으로 감독한다.
- 가장 넓은 모델의 소프트 레이블을 사용해 오프라인 시퀀스 수준 자기 정규화 기법을 도입하여 더 작은 하위 트랜스포머를 추가로 정교화한다.
- 훈련 중에 다양한 하위 트랜스포머 너비를 무작위로 샘플링하여 다양한 스케일에서의 강건성과 일반화 능력을 확보한다.
- 가장 넓은 모델을 잘라내어 더 작은, 배포 가능한 버전을 동적으로 추론할 수 있도록 한다.
- 다양한 독립된 모델을 훈련하는 것에 비해 메모리 및 계산 비용을 크게 줄일 수 있도록 파라미터 공유를 활용한다.
실험 결과
연구 질문
- RQ1재훈련 없이 FLOPs와 파라미터 수의 다양한 추론 스케일을 지원할 수 있는 단일 트랜스포머 모델을 훈련시킬 수 있는가?
- RQ2공유된 파라미터를 사용해 서로 다른 크기의 하위 트랜스포머를 함께 훈련할 때 발생하는 훈련 간섭을 어떻게 완화할 수 있는가?
- RQ3자기 정규화 기법이 더 작은 하위 트랜스포머의 성능을 향상시키면서도 가장 큰 모델의 성능을 유지하거나 향상시킬 수 있는가?
- RQ4훈련 후 최적의 하위 트랜스포머를 검색할 수 있는 능력이 독립적으로 훈련된 가장 넓은 모델을 훈련하는 것보다 더 높은 성능을 낼 수 있는가?
- RQ5제안된 방법이 총 훈련 및 저장 비용을 줄이며 최신 기술 수준의 성능을 달성하거나 이를 상회할 수 있는가?
주요 결과
- 유형-2 확장 가능한 트랜스포머에서 무작위로 선택한 최상의 하위 트랜스포머가 WMT En-De 테스트 세트에서 29.7 BLEU를 기록했으며, 원래 가장 넓은 트랜스포머(29.3 BLEU)를 초월했다.
- 유형-2 모델의 상위 10개 하위 트랜스포머는 테스트 세트에서 평균 29.60 ± 0.061 BLEU를 기록했으며, 모두 독립적으로 훈련된 가장 넓은 트랜스포머의 성능을 초월했다.
- 확장 가능한 트랜스포머를 훈련하는 데에는 8개의 V100 GPU에서 212시간과 209M 파라미터가 소요되었고, 다양한 너비를 가진 12개의 독립 모델을 훈련시키는 데에는 712시간과 1.29B 파라미터가 필요했다.
- 유형-1 ST 모델은 En-De에서 29.3 BLEU, En-Fr에서 43.1 BLEU를 기록했으며, 기준 트랜스포머와 유사한 성능을 보였고, 13개의 서로 다른 크기의 하위 모델이 동일한 파라미터를 공유했다.
- 유형-2 ST의 성능 향상은 체크포인트 평균화 때문이 아니며, 독립적으로 훈련된 가장 넓은 모델의 1,000개 체크포인트 중 상위 10개 모델을 평균화한 결과 29.4 BLEU에 그쳤고, 여전히 유형-2 ST의 최상위 하위 모델 성능 이하였다.
- 이 방법은 영향력 있는 배포를 가능하게 하며, 어떤 하위 트랜스포머도 재훈련 없이 가장 넓은 모델을 잘라내어 얻을 수 있어 훈련 및 메모리 오버헤드를 크게 줄였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.