Skip to main content
QUICK REVIEW

[논문 리뷰] Finding Fast Transformers: One-Shot Neural Architecture Search by Component Composition

Henry Tsai, Jayden Ooi|arXiv (Cornell University)|2020. 08. 15.
Topic Modeling참고 문헌 21인용 수 12
한 줄 요약

이 논문은 구성 요소 수준의 아키텍처 선택에서 샘플링하여 빠른 Transformer 모델을 구성하는 one-shot 신경망 아키텍처 탐색 방법을 제안한다. 추론 속도를 최적화하면서도 높은 정확도를 유지한다. BERT를 모듈화된 구성 요소로 재구성하고, 프로파일링 인식 목표 함수를 사용한 샘플링 기반 탐색을 통해, BERT-base에서 10–30%의 속도 향상을, 정제된 모델에서는 최대 70%의 속도 향상을 달성하며 정확도 손실는 최소한도로 유지한다.

ABSTRACT

Transformer-based models have achieved stateof-the-art results in many tasks in natural language processing. However, such models are usually slow at inference time, making deployment difficult. In this paper, we develop an efficient algorithm to search for fast models while maintaining model quality. We describe a novel approach to decompose the Transformer architecture into smaller components, and propose a sampling-based one-shot architecture search method to find an optimal model for inference. The model search process is more efficient than alternatives, adding only a small overhead to training time. By applying our methods to BERT-base architectures, we achieve 10% to 30% speedup for pre-trained BERT and 70% speedup on top of a previous state-of-the-art distilled BERT model on Cloud TPU-v2 with a generally acceptable drop in performance.

연구 동기 및 목표

  • 모델 품질을 희생시키지 않고도 빠른 Transformer 아키텍처를 탐색할 수 있는 효율적인 방법을 개발하는 것.
  • 특히 실세계 배포 환경에서의 느린 추론 문제를 해결하는 것.
  • 훈련 오버헤드를 최소화하면서 직접적으로 추론 속도를 최적화하는 one-shot 아키텍처 탐색을 가능하게 하는 것.
  • 다양한 NLP 작업에서 빠른 모델을 얻기 위해 아키텍처 구성 요소를 어떻게 조합할 수 있는지 탐색하는 것.
  • 기존의 탐색 방법보다 구성 요소 수준의 탐색이 속도와 효율성 면에서 뛰어나다는 것을 입증하는 것.

제안 방법

  • Transformer 아키텍처가 주의 헤드, 피드포워드 레이어, 정규화 레이어 등 모듈화된 구성 요소로 분해되며, 각 구성 요소는 독립적으로 확장하거나 잘라낼 수 있다.
  • 단일 훈련 런에서 아키텍처 조합을 탐색할 수 있도록 샘플링 기반 one-shot 탐색 알고리즘을 제안한다. 이로써 다수의 훈련 루프가 필요로 하는 것을 방지한다.
  • 외부 계산 프로파일링 데이터를 통합한 탐색 목표 함수를 사용하여 FLOPs와 같은 대체 지표에 의존하지 않고 직접적으로 추론 속도를 최적화한다.
  • 깊이 및 폭과 같은 구성 요소 수준의 하이퍼파라미터를 동시에 샘플링함으로써 모델의 깊이와 폭을 통합 최적화할 수 있다.
  • 학습에서부터 시작하는 것과 지식 정제와의 통합 모두를 지원하여 정제된 모델의 효율적인 미세조정을 가능하게 한다.
  • 정규화를 통한 미분 가능 샘플링 전략을 사용하여 효율적이고 고속의 아키텍처를 유도한다.

실험 결과

연구 질문

  • RQ1훈련 오버헤드를 최소화하면서 깊이와 폭의 상호 교환 관계를 효율적으로 탐색할 수 있는 one-shot 아키텍처 탐색 방법을 설계할 수 있는가?
  • RQ2구성 요소 수준의 아키텍처 조합이 정확도 손실 없이 더 빠른 추론을 달성하는 데 얼마나 효과적인가?
  • RQ3실제 하드웨어 프로파일링 데이터를 탐색 목표 함수에 통합하면 FLOPs 기반 목표 함수보다 더 나은 추론 속도를 달성할 수 있는가?
  • RQ4제안된 방법이 다양한 NLP 작업에서 사전 학습된 모델과 정제된 BERT 모델을 모두 향상시킬 수 있는가?
  • RQ5다양한 복잡도를 가진 작업, 예를 들어 품사 태깅과 형태소 분석과 같은 작업 간에 아키텍처 선택은 어떻게 다를까?

주요 결과

  • 다음 작업에서 정확도가 0.5–1.0% 감소하는 조건에서 사전 학습된 BERT-base 모델에서 10–30%의 추론 속도 향상을 달성한다.
  • 정제된 BERT 모델에서는 최대 70%의 속도 향상(기준 대비 3.5배 빠름)을 달성하면서도 유사한 정확도를 유지한다.
  • 선택된 아키텍처는 작업에 따라 크게 다름: 1000개 이상의 클래스가 필요한 형태소 분석 작업은 품사 태깅과 같은 작은, 빠른 모델보다 더 큰 모델이 필요로 한다.
  • 샘플링 기반 직접 최적화(SDO) 알고리즘이 드롭아웃 기반 최적화(DO)보다 성능이 뛰어나며, 형태소 분석 작업에서 SDO는 36배의 속도 향상을 달성했고, DO는 33배의 속도 향상을 달성했으며 정확도는 유사하다.
  • 탐색 과정은 단지 1.4배의 훈련 시간 오버헤드와 최소한의 메모리 비용만을 추가하여 대규모 모델에 대해서도 실용적이다.
  • SDO-R를 사용할 경우 이전 최고 수준의 정제된 BERT 모델보다 1.7배 빠른 속도 향상을 달성할 수 있으며, 재훈련이 필요 없어 훈련 자원을 2배 절약할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.