[논문 리뷰] AutoBERT-Zero: Evolving BERT Backbone from Scratch
이 논문은 유연한 검색 공간을 통해 기본 수학 연산과 컨볼루션 블록을 조합한 새로운 신경망 아키텍처 탐색 프레임워크인 AutoBERT-Zero를 제안한다. Bi-branch Weight-Sharing를 활용한 Operation-Priority NAS(OP-NAS) 알고리즘을 도입하여 효율적인 평가를 구현함으로써, BERT, RoBERTa, BERT-large보다 GLUE 벤치마크에서 각각 2.4점과 1.4점 높은 점수를 기록하는 하이브리드 아키텍처를 발견하였다. 이는 FLOPs, 지연 시간, 메모리 사용량을 감소시키는 데 성공하였다.
Transformer-based pre-trained language models like BERT and its variants have recently achieved promising performance in various natural language processing (NLP) tasks. However, the conventional paradigm constructs the backbone by purely stacking the manually designed global self-attention layers, introducing inductive bias and thus leads to sub-optimal. In this work, we make the first attempt to automatically discover novel pre-trained language model (PLM) backbone on a flexible search space containing the most fundamental operations from scratch. Specifically, we propose a well-designed search space which (i) contains primitive math operations in the intra-layer level to explore novel attention structures, and (ii) leverages convolution blocks to be the supplementary for attentions in the inter-layer level to better learn local dependency. To enhance the efficiency for finding promising architectures, we propose an Operation-Priority Neural Architecture Search (OP-NAS) algorithm, which optimizes both the search algorithm and evaluation of candidate models. Specifically, we propose Operation-Priority (OP) evolution strategy to facilitate model search via balancing exploration and exploitation. Furthermore, we design a Bi-branch Weight-Sharing (BIWS) training strategy for fast model evaluation. Extensive experiments show that the searched architecture (named AutoBERT-Zero) significantly outperforms BERT and its variants of different model capacities in various downstream tasks, proving the architecture's transfer and scaling abilities. Remarkably, AutoBERT-Zero-base outperforms RoBERTa-base (using much more data) and BERT-large (with much larger model size) by 2.4 and 1.4 higher score on GLUE test set.
연구 동기 및 목표
- BERT 및 그 변종에서 수동으로 설계된 자기주의 기반의 유도 편향과 열악한 성능을 해결하기 위해.
- 사전 학습된 언어 모델(PLM)을 위한 더 효율적이고 강력한 주의 구조와 백본 아키텍처를 다시 발견하기 위해.
- 글로벌 및 로컬 의존성을 개선하기 위해 레이어 내부 연산과 레이어 간 글로벌(주의) 및 로컬(컨볼루션) 연산을 조합한 탄력적인 검색 공간을 설계하기 위해.
- PLM 아키텍처 탐색에 있어 계산 비용을 줄이는 데 효과적인 NAS 알고리즘을 개발하여 실용적인 고성능 아키텍처 탐색을 가능하게 하기 위해.
- 검색된 아키텍처의 이식 가능성과 확장성을 다양한 모델 크기와 다운스트림 NLP 작업 간에 검증하기 위해.
제안 방법
- 레이어 내부 연산(덧셈, 곱셈 등과 같은 기본 수학 연산)을 포함한 탄력적인 검색 공간을 제안하여, 다양한 경로 길이와 입력 노드를 가진 새로운 주의 구조를 탐색한다.
- 자기주의와 컨볼루션 블록을 조합한 레이어 간 검색 공간을 도입하여, 레이어 간 글로벌 및 로컬 특징 학습을 균형 있게 유지한다.
- 신뢰도 기반 UCB 선택을 사용하여 아키텍처 변형 과정에서 탐색과 이용의 균형을 이루는 Operation-Priority(OP) 진화 전략을 개발한다.
- 주의 및 컨볼루션 구성 요소의 슈퍼넷 브랜치 간 가중치 공유를 통해 모델 평가를 가속화하는 Bi-branch Weight-Sharing(BIWS) 학습 전략을 설계한다.
- 초기 학습 40k 스텝 후 GLUE 미세조정을 통한 프록시 평가 파이프라인을 활용하여 후보 아키텍처를 효율적으로 순위 매긴다.
- 이중 단계 학습 프로세스를 사용한다: 첫 번째 단계는 BIWS를 통한 빠른 평가를 통한 NAS, 두 번째 단계는 표준 하이퍼파rameter를 사용하여 표준 벤치마크에서의 완전한 미세조정.
실험 결과
연구 질문
- RQ1신경망 아키텍처 탐색 프레임워크는 수동으로 설계된 자기주의 기반의 주의 메커니즘보다 더 효과적이고 효율적인 PLM 백본을 발견할 수 있는가?
- RQ2학습된 주의 구조와 컨볼루션 연산을 조합하면 사전 학습된 언어 모델의 성능과 효율성을 향상시킬 수 있는가?
- RQ3효율적인 NAS 알고리즘이 PLM 백본 탐색에 있어 계산 비용을 크게 줄일 수 있는가, 동시에 높은 성능을 유지할 수 있는가?
- RQ4검색된 아키텍처는 다양한 모델 크기와 다운스트림 NLP 작업 간에 잘 일반화되는가?
- RQ5발견된 아키텍처는 더 적은 데이터와 더 작은 크기로 기존 최신 기술 모델인 RoBERTa와 BERT-large를 능가할 수 있는가?
주요 결과
- AutoBERT-Zero-base는 GLUE 점수 86.3점을 기록하여 RoBERTa-base(83.9점)와 BERT-large(84.9점)를 각각 2.4점과 1.4점 초월한다.
- V100에서 BERT-base 대비 FLOPs는 20.7% 감소(2.3e10 vs. 2.9e10), 추론 지연 시간은 7.2% 감소(27.2초 vs. 29.3초)하였다.
- AutoBERT-Zero-base는 104M 파라미터를 사용하여 BERT-base(110M)보다 약간 적은 수치를 기록하면서도 더 높은 성능를 달성하였다.
- 메모리 점유율은 2.1GB로 BERT-base(2.5GB) 대비 16% 감소하여 더 나은 메모리 효율성을 입증하였다.
- BIWS 학습 전략은 총 탐색 비용을 약 182K GPU 시간에서 24K GPU 시간으로 줄여 효율성을 크게 향상시켰다.
- 검색된 아키텍처는 강력한 이식성을 보이며, GLUE, SQuAD v1.1, SQuAD v2.0 및 기타 벤치마크에서 최신 기술 수준의 성능을 달성하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.