Skip to main content
QUICK REVIEW

[논문 리뷰] MLModelScope: A Distributed Platform for Model Evaluation and Benchmarking at Scale

Abdul Dakkak, Cheng Li|arXiv (Cornell University)|2020. 02. 19.
Machine Learning in Materials Science인용 수 5
한 줄 요약

MLModelScope는 표준화된 사양과 확장 가능한 런타임을 통해 확장성 있고 반복 가능하며 공정한 모델 평가 및 벤치마킹을 가능하게 하는 분산형이며 프레임워크 및 하드웨어에 종속되지 않는 플랫폼입니다. 다양한 하드웨어와 소프트웨어 스택에서 병렬 평가를 지원하며, 계층 및 라이브러리 수준에서 성능 저하 요인을 파악할 수 있는 내통성 기능을 제공합니다. 이는 동일한 모델과 하드웨어에서 TensorRT와 Caffe2와 같은 프레임워크 간에 뚜렷한 성능 차이가 있음을 입증합니다.

ABSTRACT

Machine Learning (ML) and Deep Learning (DL) innovations are being introduced at such a rapid pace that researchers are hard-pressed to analyze and study them. The complicated procedures for evaluating innovations, along with the lack of standard and efficient ways of specifying and provisioning ML/DL evaluation, is a major "pain point" for the community. This paper proposes MLModelScope, an open-source, framework/hardware agnostic, extensible and customizable design that enables repeatable, fair, and scalable model evaluation and benchmarking. We implement the distributed design with support for all major frameworks and hardware, and equip it with web, command-line, and library interfaces. To demonstrate MLModelScope's capabilities we perform parallel evaluation and show how subtle changes to model evaluation pipeline affects the accuracy and HW/SW stack choices affect performance.

연구 동기 및 목표

  • 빠르게 변화하는 머신러닝/딥러닝 모델, 프레임워크, 하드웨어 스택을 반복 가능하고 공정한 방식으로 평가하는 데 도전하는 문제를 해결하기 위해.
  • 사양과 하드웨어/소프트웨어 프로비저닝을 분리함으로써 모델 평가에 소요되는 복잡성과 시간을 줄이기 위해.
  • 다양한 머신러닝 프레임워크와 가속기에서 재현 가능한 벤치마킹을 지원하는 표준화되고 확장성 있으며 사용자 정의가 가능한 플랫폼을 제공하기 위해.
  • 모델 실행의 세밀한 내통성을 제공하여 계층 및 라이브러리 수준에서 성능 저하 요인을 식별하기 위해.
  • 일致된 보고 및 재현 가능성 보장을 제공하는 대규모 병렬 평가를 지원하기 위해.

제안 방법

  • 플랫폼은 모델 파이프라인 단계(전처리, 추론, 후처리)를 기반 하드웨어/소프트웨어 스택에서 분리하는 텍스트 기반 모델 평가 사양을 사용합니다.
  • 분산 런타임 시스템은 사양과 사용자가 정의한 하드웨어 제약 조건을 소비하여 이질적인 환경에서 평가를 프로비저닝하고 실행합니다.
  • 시스템은 여러 머신러닝 프레임워크(예: PyTorch, TensorFlow, Caffe2, TensorRT)와 하드웨어 플랫폼(x86, ARM, Power, CPU, GPU, FPGA)을 지원합니다.
  • 사용자 편의와 통합을 위해 명령줄 인터페이스, 라이브러리 인터페이스, 웹 UI를 포함한 세 가지 접근 방식을 제공합니다.
  • 플랫폼은 계층 및 라이브러리 수준에서 지연 시간과 메모리 사용량을 캡처하는 프로파일러를 포함하여 성능 내통성을 제공합니다.
  • 평가 결과는 일致된 방식으로 보고되어 모델, 프레임워크, 하드웨어 구성 간에 공정한 비교가 가능합니다.

실험 결과

연구 질문

  • RQ1다양한 하드웨어 및 소프트웨어 스택에서 모델 평가를 어떻게 확장성 있고 반복 가능하며 공정하게 만들 수 있는가?
  • RQ2동일한 하드웨어에서 프레임워크의 실행 구현 방식 차이가 모델 추론 성능에 어느 정도의 영향을 미치는가?
  • RQ3통합된 사양과 런타임 시스템은 대규모 모델 벤치마킹에 소요되는 시간과 복잡성을 줄일 수 있는가?
  • RQ4하드웨어 및 소프트웨어 스택 선택이 계층 및 라이브러리 수준에서 모델 정확도와 성능에 어떤 영향을 미치는가?
  • RQ5다양한 프레임워크에서 하위 모델 수준의 정밀한 내통성 분석을 통해 어떤 통찰을 얻을 수 있는가?

주요 결과

  • MLModelScope는 다양한 하드웨어 및 소프트웨어 스택에서 일致하고 재현 가능한 결과를 제공하는 병렬적이고 확장 가능한 모델 평가를 가능하게 합니다.
  • 동일한 하드웨어(아마존 p3.2xlarge)에서 TensorRT는 첫 번째 conv2와 ReLU 레이어를 하나의 커널로 융합하여 1.95ms에 실행했지만, Caffe2는 이를 융합하지 않아 더 긴 2.63ms의 실행 시간을 기록했습니다.
  • 플랫폼의 내통성 기능은 서로 다른 프레임워크가 동일한 모델 레이어를 다른 라이브러리 함수로 구현하여 측정 가능한 성능 차이를 유발함을 드러냈습니다.
  • MLModelScope는 MLPerf Inference 및 AI-Matrix와 같은 벤치마크 스위트의 모델을 성공적으로 통합하여 분산 평가 및 프로파일링 기능을 활용할 수 있도록 했습니다.
  • 전처리 작업과 같은 평가 파이프라인의 미세한 변화가 최종 정확도 및 성능 결과에 영향을 줄 수 있음을 입증했습니다.
  • 사양과 실행을 분리함으로써 MLModelScope는 모델 평가자들이 테스트까지의 시간을 단축시키고, 다양한 모델과 스택 간에 일致하고 공정한 비교를 지원합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.