Skip to main content
QUICK REVIEW

[논문 리뷰] Real-Time Execution of Large-scale Language Models on Mobile

Wei Niu, Zhenglun Kong|arXiv (Cornell University)|2020. 09. 15.
Topic Modeling참고 문헌 22인용 수 10
한 줄 요약

이 논문은 컴파일러 수준 최적화를 나스 루프에 통합하여 모바일 디바이스에서 BERT 모델의 정확도와 추론 지연 시간을 동시에 최적화하는 컴파일러 인지 신경망 아키텍처 탐색 프레임워크를 제안한다. 이 프레임워크는 텐서플로우 라이트 대비 최대 7.8배의 속도 향상을 이룩했으며, 정확도 손실은 0.5–2%에 불과하여 소비자용 모바일 하드웨어에서 대규모 트랜스포머 모델의 실시간 추론을 가능하게 한다.

ABSTRACT

Pre-trained large-scale language models have increasingly demonstrated high accuracy on many natural language processing (NLP) tasks. However, the limited weight storage and computational speed on hardware platforms have impeded the popularity of pre-trained models, especially in the era of edge computing. In this paper, we seek to find the best model structure of BERT for a given computation size to match specific devices. We propose the first compiler-aware neural architecture optimization framework. Our framework can guarantee the identified model to meet both resource and real-time specifications of mobile devices, thus achieving real-time execution of large transformer-based models like BERT variants. We evaluate our model on several NLP tasks, achieving competitive results on well-known benchmarks with lower latency on mobile devices. Specifically, our model is 5.2x faster on CPU and 4.1x faster on GPU with 0.5-2% accuracy loss compared with BERT-base. Our overall framework achieves up to 7.8x speedup compared with TensorFlow-Lite with only minor accuracy loss.

연구 동기 및 목표

  • 자원이 제한된 모바일 디바이스에서 실시간 지연 시간 요구 조건을 충족시키면서도 대규모 사전 학습된 언어 모델(예: BERT)을 구현하는 데 도전하는 것.
  • 하드웨어 인지 신경망 아키텍처 탐색과 실제 컴파일러 최적화 사이의 격차를 메우며, 깊이 있는 계층을 가진 모델에서는 종종 나스 결과가 효과를 잃게 되는 문제를 해결하는 것.
  • 모델 아키텍처와 컴파일러 수준 최적화(예: 레이어 융합)를 동시에 최적화하여 모바일 CPU와 GPU에서 저지연, 고정확도 추론을 달성하는 것.
  • 기존 주요 프레임워크(예: 텐서플로우 라이트)에서 지원하지 못했던 바, 모바일 CPU 및 GPU에서 BERT 버전의 실시간 실행을 가능하게 하는 것.

제안 방법

  • 컴파일러 최적화를 나스 루프에 통합하여 실시간 및 자원 제약 조건을 충족하는 모델을 생성하는 컴파일러 인지 신경망 아키텍처 탐색(NAS) 프레임워크를 도입한다.
  • 정확도와 지연 시간을 고려하여 최적의 BERT 아키텍처를 탐색하기 위해, GLUE 벤치마크에서의 미세조정을 통해 빠른 평가를 수행하는 컨트롤러-트레이너 파라다임을 활용한다.
  • 중간 텐서 메모리와 계산 오버헤드를 줄이기 위해 새로운 레이어 융합 기법을 적용하여 CPU 및 GPU 모두에서 성능을 크게 향상시킨다.
  • 두 단계로 이루어진 훈련 과정을 사용한다: 먼저 깊고 좁은 BERT 변종(28개 블록)을 훈련한 후, 지식 정착을 통해 더 효율적인 스튜던트 모델로 변환한다.
  • 모델 구조를 분석하고 장치별 최적화(예: 융합된 레이어 실행 포함)를 적용하는 컴파일러 파이프라인을 통해 최적화된 추론 코드를 생성한다.
  • 실제 모바일 디바이스(예: 삼성 갤럭시 S20, S10)에서 HuggingFace 및 커스텀 컴파일레이션 파이프라인을 사용하여 실세계 지연 시간과 정확도를 측정한다.

실험 결과

연구 질문

  • RQ1컴파일러 인지 신경망 아키텍처 탐색을 통해 대규모 BERT 모델의 실시간 추론을 위한 모델 구조와 컴파일레이션을 동시에 최적화할 수 있는가?
  • RQ2레이어 융합이 깊은 트랜스포머 모델에 특히 효과적으로 작용하여 모바일 CPU 및 GPU에서 추론 지연 시간을 크게 줄일 수 있는가?
  • RQ3컴파일러 피드백를 포함한 나스 프레임워크가 기존의 하드웨어 인지 나스 또는 텐서플로우 라이트와 같은 기존 추론 프레임워크보다 더 나은 지연 시간-정확도 트레이드오���을 달성할 수 있는가?
  • RQ4모바일 GPU에서 BERT 버전의 실시간 추론이 가능한가? 그리고 CPU 실행 및 텐서플로우 라이트와 비교해 볼 때 어떤가?

주요 결과

  • 제안된 프레임워크는 텐서플로우 라이트 대비 모바일 GPU에서 최대 7.8배의 속도 향상을 기록했으며, 나스를 적용한 BERT(ours)는 CPU에서 BERT BASE 대비 5.2배, GPU에서 4.1배 빠르게 작동한다.
  • 정확도 손실이 0.5–2%에 불과한 최적화된 BERT 모델은 GLUE 벤치마크에서 BERT BASE 및 MobileBERT보다 지연 시간과 정확도 면에서 모두 뛰어나다.
  • 레이어 융합은 중간 메모리 트래픽을 줄이고 실행을 가속화하여, 텐서플로우 라이트 대비 GPU에서 최대 2.4배, CPU에서 최대 2.0배의 속도 향상을 달성한다.
  • 이 프레임워크는 모바일 GPU에서 실시간 BERT 추론을 지원하는 최초의 프레임워크이며, 이는 이전에 텐서플로우 라이트에서 지원되지 않았다.
  • 컴파일러 최적화 없이도 기준 모델은 CPU에서는 텐서플로우 라이트와 유사한 성능을 보였지만, GPU 성능은 심각하게 떨어졌다—이는 컴파일러 수준 최적화의 필수성을 강조한다.
  • 나스 최적화 모델(BERT(ours) with NAS)은 CPU에서 MobileBERT 대비 1.49배, GPU에서 1.53배 빠르게 작동했으며, 정확도 감소는 0.4–1%에 불과했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.