Skip to main content
QUICK REVIEW

[논문 리뷰] Searching for Fast Model Families on Datacenter Accelerators

Sheng Li, Mingxing Tan|arXiv (Cornell University)|2021. 02. 10.
Advanced Neural Network Applications참고 문헌 48인용 수 4
한 줄 요약

이 논문은 TPUv3 및 GPUv100과 같은 데이터센터 가속기용으로 CNN 모델 패밀리를 최적화하기 위해 하드웨어 인지 신경망 구조 탐색(NAS)과 지연 시간 인지 복합 스케일링(LACS)을 제안한다. 공간에서 깊이로의 변환, 융합된 컨벌루션, 블록 단위 활성화 함수와 같은 가속기 우군 조건을 만족하는 연산을 포함하는 검색 공간을 설계하고 정확도와 지연 시간을 동시에 최적화함으로써, 정확도는 유사한 수준을 유지하면서 추론 속도가 최대 2.3배 빠른 EfficientNet-X를 발견하였다.

ABSTRACT

Neural Architecture Search (NAS), together with model scaling, has shown remarkable progress in designing high accuracy and fast convolutional architecture families. However, as neither NAS nor model scaling considers sufficient hardware architecture details, they do not take full advantage of the emerging datacenter (DC) accelerators. In this paper, we search for fast and accurate CNN model families for efficient inference on DC accelerators. We first analyze DC accelerators and find that existing CNNs suffer from insufficient operational intensity, parallelism, and execution efficiency. These insights let us create a DC-accelerator-optimized search space, with space-to-depth, space-to-batch, hybrid fused convolution structures with vanilla and depthwise convolutions, and block-wise activation functions. On top of our DC accelerator optimized neural architecture search space, we further propose a latency-aware compound scaling (LACS), the first multi-objective compound scaling method optimizing both accuracy and latency. Our LACS discovers that network depth should grow much faster than image size and network width, which is quite different from previous compound scaling results. With the new search space and LACS, our search and scaling on datacenter accelerators results in a new model series named EfficientNet-X. EfficientNet-X is up to more than 2X faster than EfficientNet (a model series with state-of-the-art trade-off on FLOPs and accuracy) on TPUv3 and GPUv100, with comparable accuracy. EfficientNet-X is also up to 7X faster than recent RegNet and ResNeSt on TPUv3 and GPUv100.

연구 동기 및 목표

  • TPU 및 GPU와 같은 데이터센터 가속기에서 이론적 FLOPs와 실제 추론 지연 시간 간의 성능 격차가 점점 커지는 문제를 해결하기 위해.
  • 최신 CNN에서 저조도의 연산 강도와 낮은 병렬 처리 능력 등 하드웨어 특수성에 기인한 병목 현상을 규명하기 위해.
  • 데이터센터 가속기 전용으로 최적화된 NAS 검색 공간을 설계하여 연산 강도와 실행 효율을 향상시키기 위해.
  • 정확도와 추론 지연 시간을 동시에 최적화하는 다목적 복합 스케일링 방법(LACS)을 개발하기 위해.
  • 현대 데이터센터 가속기에서 정확도-지연 시간 트레이드오프를 초월하는 우수한 성능을 보이는 새로운 모델 패밀리인 EfficientNet-X를 생성하기 위해.

제안 방법

  • TPUv3 및 GPUv100에서 옥상 모델을 사용하여 정량적 분석을 수행하여, 저조도의 연산 강도와 최적화되지 않은 병렬 처리가 FLOPs-지연 시간 비례성의 붕괴 원인임을 규명하였다.
  • 공간에서 깊이로의 변환, 공간에서 배치로의 변환, 하이브리드 융합 컨벌루션(기본형 및 깊이 지능형), 블록 단위 활성화 함수를 포함하는 DC-가속기 최적화 검색 공간을 설계하였다.
  • 정확도와 추론 지연 시간을 동시에 최적화하는 다목적 스케일링 방법인 지연 시간 인지 복합 스케일링(LACS)을 제안하였다.
  • TPUv3 및 GPUv100에서 별도의 NAS 및 LACS 프로세스를 수행하여 하드웨어에 맞는 모델 패밀리를 생성함으로써 하드웨어 인지 최적화를 보장하였다.
  • 최종적으로 생성된 모델 패밀리인 EfficientNet-X를 TPUv3 및 GPUv100에서 훈련 및 평가하여 SOTA 기준 모델들과의 지연 시간과 정확도를 비교하였다.
  • TPUv2에서 TPUv3로의 이식 시 성능 향상을 측정하여 가속기 세대 간 일반화 성능을 검증하였다.
Figure 1: Unified accelerator-optimized NAS and Latency-aware Compound Scaling (LACS) to search model families optimized for TPUs and GPUs. The same multi-objective with both latency and accuracy is used for both NAS and model scaling. For a given accelerator, a base model (m1) is obtained via NAS w
Figure 1: Unified accelerator-optimized NAS and Latency-aware Compound Scaling (LACS) to search model families optimized for TPUs and GPUs. The same multi-objective with both latency and accuracy is used for both NAS and model scaling. For a given accelerator, a base model (m1) is obtained via NAS w

실험 결과

연구 질문

  • RQ1CPU와는 달리 TPU 및 GPU와 같은 데이터센터 가속기에서 왜 FLOPs-지연 시간 관계가 붕괴되는가?
  • RQ2TPU 및 GPU의 하드웨어 특성을 더 잘 활용하기 위해 신경망 구조 탐색(NAS)을 어떻게 향상시킬 수 있는가?
  • RQ3어떤 아키텍처 구성 요소가 데이터센터 가속기에서 연산 강도와 실행 효율을 향상시키는가?
  • RQ4정확도와 지연 시간을 동시에 최적화하는 다목적 복합 스케일링과 단일 목표 스케일링 간의 최적 스케일링 계수는 어떻게 다를까?
  • RQ5제안된 방법이 다양한 세대의 데이터센터 가속기 간에 얼마나 잘 일반화되는가?

주요 결과

  • EfficientNet-X는 TPUv3에서 EfficientNet 대비 최대 2.3배 빠른 추론 속도를 기록했으며, GPUv100에선 최대 2.1배 빠르게 작동했고, 정확도는 유사한 수준을 유지하였다.
  • TPUv3에서 EfficientNet-X는 RegNet 대비 7배 빠르며, ResNeSt 대비 평균 48% 빠르게 작동했으며, 각각 7배와 48%의 성능 향상을 기록하였다.
  • GPUv100에서 EfficientNet-X는 RegNet 대비 평균 82% 빠르며, ResNeSt 대비 평균 48% 더 빠르게 작동하였다.
  • TPUv2에서 TPUv3로의 이식(2배의 피크 성능 향상) 시, EfficientNet-X는 약 1.9배의 기하평균 성능 향상을 기록했으며, 이는 EfficientNet의 약 1.5배 성능 향상 대비 약 30% 높은 스케일링 효율성을 보였다.
  • LACS는 네트워크의 깊이가 이미지 해상도와 너비보다 훨씬 더 빠르게 증가해야 한다고 발견하여, 이는 이전의 복합 스케일링 관행과 정반대되는 결과였다.
  • 이 방법은 가속기 세대 간에 잘 일반화되었으며, 하드웨어 인지 설계가 하드웨어 업그레이드 시 성능 향상에 기여함을 입증하였다.
Figure 2: Rooflines of TPUv3, Volta SMX2 GPU, and Xeon Skylake CPU. TPU and GPU have overlapped rooflines because of their similar peak computation rate and memory bandwidth.
Figure 2: Rooflines of TPUv3, Volta SMX2 GPU, and Xeon Skylake CPU. TPU and GPU have overlapped rooflines because of their similar peak computation rate and memory bandwidth.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.