[논문 리뷰] Neural Architecture Search on Efficient Transformers and Beyond
이 논문은 효율적인 트랜스포머를 위한 최적 아키텍처를 자동으로 탐색하기 위해 신경망 아키텍처 탐색(NAS) 프레임워크를 제안한다. 특히 커널 기반의 cosFormer을 대상으로 한다. 소프트맥스 및 선형 어텐션을 조합한 혼합 어텐션 검색 공간을 도입함으로써, 표준 트랜스포머 수준의 성능를 달성하면서도 계산 효율성이 크게 향상된 결과를 얻었으며, 순수하게 효율적인 모델보다 정확도를 높이면서도 FLOPS는 낮게 유지한다.
Recently, numerous efficient Transformers have been proposed to reduce the quadratic computational complexity of standard Transformers caused by the Softmax attention. However, most of them simply swap Softmax with an efficient attention mechanism without considering the customized architectures specially for the efficient attention. In this paper, we argue that the handcrafted vanilla Transformer architectures for Softmax attention may not be suitable for efficient Transformers. To address this issue, we propose a new framework to find optimal architectures for efficient Transformers with the neural architecture search (NAS) technique. The proposed method is validated on popular machine translation and image classification tasks. We observe that the optimal architecture of the efficient Transformer has the reduced computation compared with that of the standard Transformer, but the general accuracy is less comparable. It indicates that the Softmax attention and efficient attention have their own distinctions but neither of them can simultaneously balance the accuracy and efficiency well. This motivates us to mix the two types of attention to reduce the performance imbalance. Besides the search spaces that commonly used in existing NAS Transformer approaches, we propose a new search space that allows the NAS algorithm to automatically search the attention variants along with architectures. Extensive experiments on WMT' 14 En-De and CIFAR-10 demonstrate that our searched architecture maintains comparable accuracy to the standard Transformer with notably improved computational efficiency.
연구 동기 및 목표
- 표준 트랜스포머 설계에서 유도된 수작업 아키텍처가 효율적 트랜스포머에서 최적의 성능을 내지 못하는 문제를 해결하기 위해.
- NAS가 선형 어텐션과 같은 효율적 어텐션 메커니즘을 위해 특화된 맞춤형 아키텍처를 탐색할 수 있는지 조사하기 위해.
- 소프트맥스 어텐션을 선형 어텐션으로 대체할 경우, 효율적 트랜스포머에서 정확도와 효율성 간의 트레이드오���을 탐색하기 위해.
- 소프트맥스와 선형 어텐션을 하나의 모델 내에서 조합하는 새로운 혼합 어텐션 메커니즘을 제안하고 검증하기 위해.
- 기계 번역 및 이미지 분류와 같은 실제 작업에서 제안된 NAS 프레임워크의 효과성을 입증하기 위해.
제안 방법
- 쌍별 순위 매기기와 하드웨어 인식 제약 조건을 사용하여 검색 비용을 줄이고 RankNAS 프레임워크를 도입해 신경망 아키텍처 탐색을 가속화한다.
- 층별로 아키텍처 하이퍼파rameter(예: 헤드 수, 피드포워드 차원)와 어텐션 유형(소프트맥스 대비 선형)을 동시에 탐색할 수 있도록 새로운 검색 공간을 설계한다.
- cosFormer을 효율적 트랜스포머 모델의 대상으로 삼고, 소프트맥스 어텐션을 선형 어텐션으로 대체하여 O(N) 복잡도로 효율적인 계산을 가능하게 한다.
- 일반화 성능 평가를 위해 WMT’14 En-De 기계 번역과 CIFAR-10 이미지 분류 두 가지 벤치마크 작업에서 NAS를 수행한다.
- 검색 결과에 기반해 층별로 소프트맥스 또는 선형 어텐션 중 하나를 동적으로 선택하는 mFormer 아키텍처를 도입하여 하이브리드 어텐션 메커니즘을 구현한다.
- 검색 공간 정제와 조기 정지 기법을 적용하여 NAS 과정 중 효율성을 향상시키면서도 모델 품질을 손상시키지 않는다.
실험 결과
연구 질문
- RQ1수작업으로 설계된 아키텍처가 표준 트랜스포머를 위해 처음 만들어졌지만, 효율적 트랜스포머에 더 적합한 아키텍처를 NAS가 탐색할 수 있는가?
- RQ2동일한 검색 공간을 사용할 때, 순수하게 효율적인 트랜스포머(예: cosFormer)의 정확도와 FLOPS는 표준 트랜스포머와 비교해 어떻게 되는가?
- RQ3소프트맥스와 선형 어텐션을 혼합한 혼합 어텐션 메커니즘이, 각각을 독립적으로 사용할 때보다 정확도와 계산 효율성 간의 균형을 더 잘 달성하는가?
- RQ4다양한 작업에서 NAS가 효율적 트랜스포머를 위한 최적 아키텍처를 탐색할 때 나타나는 아키텍처 패턴은 무엇인가?
- RQ5제안된 NAS 프레임워크는 표준 트랜스포머보다 훨씬 낮은 FLOPS를 유지하면서도 높은 정확도를 달성할 수 있는가?
주요 결과
- 효율적인 cosFormer 모델의 최적 아키텍처는 표준 트랜스포머보다 18% 적은 파라미터와 18% 낮은 FLOPS를 가지지만, 정확도는 낮아 성능-효율성 불균형을 보였다.
- 소프트맥스와 선형 어텐션을 혼합한 mFormer 모델은 표준 트랜스포머와 유사한 BLEU 점수(1.51점 낮음)를 달성하면서도 FLOPS를 23% 감소시키고 파라미터를 20% 줄였다.
- CIFAR-10에서 mFormer은 cosFormer*보다 정확도를 5.19%p 높였고, FLOPS는 오직 1.38G 증가에 그쳐, 더 뛰어난 균형을 보였다.
- mFormer의 모든 선형 어텐션을 소프트맥스로 대체하면 정확도는 약간 향상되지만 FLOPS는 크게 증가하여 효율성-비용 트레이드오프를 확인했다.
- Transformer*의 모든 소프트맥스 어텐션을 선형 어텐션으로 대체하면 정확도가 크게 떨어졌으며, 특히 이미지 분류 작업에서 두드러졌다. 이는 선형 어텐션의 정확도 민감한 작업에서의 한계를 보여준다.
- mFormer 아키텍처는 혼합 어텐션을 갖춘 '얕고 얇은' 설계를 특징으로 하며, 25%의 층(예: Layer 3, 7, 11)에서 선형 어텐션을 사용하고 나머지 층은 소프트맥스 어텐션을 사용한다. 헤드 수는 피드포워드 차원과 반비례한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.