[논문 리뷰] HAT: Hardware-Aware Transformers for Efficient Natural Language Processing
HAT는 특정 하드웨어 플랫폼에 맞게 최적화된 효율적인 Transformer 모델을 발견하기 위해 하드웨어 인식 신경망 아키텍처 탐색 프레임워크를 제안한다. 가중치 공유 슈퍼트랜스포머를 훈련하고 실제 하드웨어 지연 시간 피드백을 활용한 진화적 탐색을 통해 HAT는 라즈베리 파이-4에서 Transformer-Big 대비 최대 3배의 추론 속도 향상과 3.7배의 더 작은 모델 크기를 달성했으며, 이는 이전 작업 대비 12,041배 낮은 탐색 비용과 정확도 손실 없이 달성되었다.
Transformers are ubiquitous in Natural Language Processing (NLP) tasks, but they are difficult to be deployed on hardware due to the intensive computation. To enable low-latency inference on resource-constrained hardware platforms, we propose to design Hardware-Aware Transformers (HAT) with neural architecture search. We first construct a large design space with $ extit{arbitrary encoder-decoder attention}$ and $ extit{heterogeneous layers}$. Then we train a $ extit{SuperTransformer}$ that covers all candidates in the design space, and efficiently produces many $ extit{SubTransformers}$ with weight sharing. Finally, we perform an evolutionary search with a hardware latency constraint to find a specialized $ extit{SubTransformer}$ dedicated to run fast on the target hardware. Extensive experiments on four machine translation tasks demonstrate that HAT can discover efficient models for different hardware (CPU, GPU, IoT device). When running WMT'14 translation task on Raspberry Pi-4, HAT can achieve $ extbf{3} imes$ speedup, $ extbf{3.7} imes$ smaller size over baseline Transformer; $ extbf{2.7} imes$ speedup, $ extbf{3.6} imes$ smaller size over Evolved Transformer with $ extbf{12,041} imes$ less search cost and no performance loss. HAT code is https://github.com/mit-han-lab/hardware-aware-transformers.git
연구 동기 및 목표
- CPU, GPU, IoT 디바이스와 같은 자원 제약이 있는 하드웨어 플랫폼에 계산량이 많은 트랜스포머를 구현하는 데 도전하는 것.
- 플랫폼 간 실제 하드웨어 성능 차이를 반영하지 못하는 FLOPs를 지연 시간의 대체 지표로 사용하는 데서 비롯되는 한계를 극복하는 것.
- 특히 하드웨어 특화 모델을 위한 신경망 아키텍처 탐색 기법의 과도한 높은 탐색 비용을 줄이는 것.
- 모델 성능을 희생시키지 않고도 효율적이고 정확하며 하드웨어 특화된 트랜스포머 모델을 가능하게 하는 것.
제안 방법
- 다양한 인코더-디코더 어텐션과 이질적인 트랜스포머 레이어를 포함한 대규모 탐색 공간을 구성하여 아키텍처의 다양성을 허용하는 것.
- 모든 하위 네트워크(서브트랜스포머) 간 가중치를 공유하는 슈퍼트랜스포머를 훈련하여 모든 후보 아키텍처의 효율적 공동 훈련을 가능하게 하는 것.
- 각 타겟 하드웨어 플랫폼에 적합한 최적의 서브트랜스포머를 식별하기 위해 실시간 하드웨어 지연 시간 피드백을 활용한 진화적 탐색을 사용하는 것.
- 측정된 지연 시간 데이터를 기반으로 훈련된 지연 시간 예측기 통합을 통해 탐색 과정을 가속화하고 하드웨어 인식 최적화를 보장하는 것.
- 슈퍼트랜스포머의 성능 프록시를 활용해 각 서브트랜스포머를 다시 처음부터 훈련할 필요 없이 탐색 비용을 극적으로 줄이는 것.
- 모델 압축 기법(예: 양자화 및 지식 distillation)과 HAT를 결합하여 추가로 효율성을 향상시키는 것.
실험 결과
연구 질문
- RQ1하드웨어 인식 신경망 아키텍처 탐색이 CPU, GPU, 엣지 디바이스와 같은 다양한 하드웨어 플랫폼에서 추론 지연 시간을 크게 줄일 수 있는가?
- RQ2실제 하드웨어 지연 시간 피드백으로 FLOPs를 대체할 경우, FLOPs 기반 최적화에 비해 더 나은 성능과 더 효율적인 트랜스포머 모델을 얻을 수 있는가?
- RQ3가중치 공유 슈퍼트랜스포머가 대규모 아키텍처 공간 내 하위 네트워크의 성능을 효과적으로 근사하여 저비용 아키텍처 탐색을 가능하게 할 수 있는가?
- RQ4임의의 인코더-디코더 어텐션과 이질적인 레이어의 조합이 다양한 하드웨어에서 모델의 효율성과 성능을 향상시키는 데 어떻게 기여하는가?
- RQ5기존의 NAS 기반 접근 방식(예: Evolved Transformer)에 비해 HAT가 훨씬 낮은 탐색 비용으로 뛰어난 효율성 향상을 달성할 수 있는가?
주요 결과
- 라즈베리 파이-4에서 HAT는 WMT’14 En-De 번역 작업에서 Transformer-Big 대비 3배의 속도 향상과 3.7배의 더 작은 모델 크기를 달성했으며, 성능 손실 없이 수행되었다.
- 동일한 작업에서 HAT는 Evolved Transformer 대비 탐색 비용을 12,041배 줄였고, 2.7배의 속도 향상과 3.6배의 더 작은 모델 크기를 달성했다.
- GPU 전용으로 훈련된 HAT 모델은 ARM CPU에서 최적화되지 않았고, 반대로 ARM CPU 전용 모델은 GPU에서 최적화되지 않았으며, 이는 다양한 지연 요인으로 인해 하드웨어 특화 최적화가 필수적임을 확인한다.
- 4비트 양자화를 적용한 HAT는 WMT’14 En-Fr 작업에서 모델 크기를 25배 감소시켰고, 전체 정밀도 기준선 대비 BLEU 점수 감소 폭이 0.1에 불과했다.
- HAT의 8비트 양자화 모델은 WMT’14 En-Fr 작업에서 전체 정밀도 모델보다 BLEU 점수 0.1 향상으로 더 나은 성능을 보이며 탐색 과정의 효과성을 입증했다.
- 실제 하드웨어 측정 데이터를 기반으로 훈련된 지연 시간 예측기는 정확하고 빠른 피드백을 제공하여 진화적 탐색을 동시에 효율적이고 하드웨어 인식적으로 만들 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.