Skip to main content
QUICK REVIEW

[논문 리뷰] AI Matrix: A Deep Learning Benchmark for Alibaba Data Centers

Wei Zhang, Wei Wei|arXiv (Cornell University)|2019. 09. 23.
Advanced Neural Network Applications참고 문헌 23인용 수 11
한 줄 요약

AI Matrix는 알리바바의 데이터 센터를 위해 개발된 종합적인 딥러닝 벤치마크 세트로, 컴퓨터 비전, 추천, 자연어 처리 분야의 실제 상용 이커머스 워크로드를 반영한다. 이 벤치마크는 알리바바 인fra에서 90%의 GPU 사용량을 포괄하며, 하드웨어 선택, 성능 분석, 시스템 최적화를 가능하게 한다. 20개의 벤치마크 중 17개는 산업 및 연구 목적을 위해 공개되었다.

ABSTRACT

Alibaba has China's largest e-commerce platform. To support its diverse businesses, Alibaba has its own large-scale data centers providing the computing foundation for a wide variety of software applications. Among these applications, deep learning (DL) has been playing an important role in delivering services like image recognition, objection detection, text recognition, recommendation, and language processing. To build more efficient data centers that deliver higher performance for these DL applications, it is important to understand their computational needs and use that information to guide the design of future computing infrastructure. An effective way to achieve this is through benchmarks that can fully represent Alibaba's DL applications.

연구 동기 및 목표

  • 알리바바의 대규모 이커머스 워크로드에 특화된 대표성 있는 딥러닝 벤치마크가 부족한 문제를 해결하기 위해.
  • 실제 알리바바 데이터 센터 내 딥러닝 응용 프로그램의 진정한 계산 요구 사항을 반영하는 벤치마크 세트를 개발하기 위해.
  • 현재 딥러닝 시스템의 성능 저하 요인을 정확히 분석함으로써 향후 하드웨어 설계 및 소프트웨어 최적화를 지원하기 위해.
  • 하드웨어 제조사, 연구자, 산업 조직이 모두 혜택을 볼 수 있도록 공개 자원을 제공하기 위해.

제안 방법

  • 알리바바의 프로덕션 시스템에서 실제 사용 중인 대표적인 딥러닝 모델을 수집하였으며, 이는 컴퓨터 비전, 추천, 언어 처리 분야를 포함한다.
  • 모델의 보편성과 계산 특성을 기반으로 선별하여, 알리바바 데이터 센터의 GPU 사용량의 90% 이상를 차지하도록 확보하였다.
  • NVIDIA V100 GPU 기반으로 FLOPs, 메모리 읽기, 산술 강도, 배치당 추론 시간 등의 핵심 성능 지표를 측정하였다.
  • 계산 및 메모리 활용도를 분석하기 위해 룻라인 모델을 구축하였으며, 높은 산술 강도에도 불구하고 자원 활용도가 낮은 현상을 규명하였다.
  • 저정밀도 추론(FP16, INT8), 혼합 정밀도 학습(FP32/FP16), 멀티 GPU 시스템에서의 분산 학습을 지원하도록 벤치마크를 설계하였다.
  • GitHub 및 AI Matrix 웹사이트를 통해 총 20개 중 17개의 벤치마크를 공개하여 커뮤니티 활용과 재현 가능성을 보장하였다.

실험 결과

연구 질문

  • RQ1기존의 딥러닝 벤치마크는 알리바바의 실제 이커머스 워크로드에 얼마나 대표적인가?
  • RQ2알리바바 데이터 센터의 프로덕션 딥러닝 워크로드에서 지배적인 계산 특성(예: 산술 강도, 메모리 액세스)은 무엇인가?
  • RQ3많은 딥러닝 모델에서 높은 산술 강도를 보일지라도 GPU 계산 자원 활용도가 최적화되지 않은 이유는 무엇인가?
  • RQ4대규모 데이터 센터에서 향후 하드웨어-소프트웨어 공동 설계를 이끌 수 있도록 프로덕션 수준의 벤치마크를 어떻게 설계할 수 있는가?
  • RQ5모델의 다양성과 규모는 시스템 수준의 성능 및 자원 활용도에 어떤 영향을 미치는가?

주요 결과

  • AI Matrix는 알리바바 데이터 센터의 GPU 사용량의 90% 이상를 커버하여 실제 프로덕션 워크로드에 매우 대표적인 특성을 지닌다.
  • 높은 산술 강도를 보일지라도, 특히 추천 및 NLP 분야의 많은 벤치마크에서 GPU 계산 자원의 활용도가 뚜렷하게 낮은 편이다.
  • 루프라인 모델 분석 결과, 고강도 워크로드에서도 메모리 대역폭 제약과 비효율적인 커널 활용도가 성능 저하의 주요 원인임을 규명하였다.
  • DIN 및 와이드 앤 데프와 같은 추천 모델은 완전 연결층과 임bedding 층의 높은 파라미터 수로 인해 낮은 산술 강도를 보인다.
  • CRNN, SegLink, BERT, NMT와 같은 컴퓨터 비전 및 NLP 모델은 컨볼루션 및 순환층 덕분에 높은 산술 강도를 보인다.
  • 벤치마크 세트는 공개되어 있으며(20개 중 17개), 하드웨어 및 소프트웨어 최적화 분야에서 더 넓은 연구 및 산업 활용을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.