Skip to main content
QUICK REVIEW

[논문 리뷰] Machine Learning Systems for Highly-Distributed and Rapidly-Growing Data

Kevin Hsieh|arXiv (Cornell University)|2019. 10. 18.
Neural Networks and Applications인용 수 4
한 줄 요약

이 박사학위 논문은 알고리즘, 모델, 데이터 특성들을 활용하여 고도로 분산되고 급격히 증가하는 데이터에 대해 지연 시간과 비용을 한 개에서 두 개의 지수 정도 감소시키는 기계학습 시스템 세트를 제시한다. 이는 대규모 영상 데이터에 대한 저지연, 저비용 추론, 최적화된 통신을 통한 고속 지리적으로 분산된 학습, 그리고 분산 학습에서의 비IIDs 데이터 분할에 대한 혁신적인 해결책을 도입한다.

ABSTRACT

The usability and practicality of any machine learning (ML) applications are largely influenced by two critical but hard-to-attain factors: low latency and low cost. Unfortunately, achieving low latency and low cost is very challenging when ML depends on real-world data that are highly distributed and rapidly growing (e.g., data collected by mobile phones and video cameras all over the world). Such real-world data pose many challenges in communication and computation. For example, when training data are distributed across data centers that span multiple continents, communication among data centers can easily overwhelm the limited wide-area network bandwidth, leading to prohibitively high latency and high cost. In this dissertation, we demonstrate that the latency and cost of ML on highly-distributed and rapidly-growing data can be improved by one to two orders of magnitude by designing ML systems that exploit the characteristics of ML algorithms, ML model structures, and ML training/serving data. We support this thesis statement with three contributions. First, we design a system that provides both low-latency and low-cost ML serving (inferencing) over large-scale and continuously-growing datasets, such as videos. Second, we build a system that makes ML training over geo-distributed datasets as fast as training within a single data center. Third, we present a first detailed study and a system-level solution on a fundamental and largely overlooked problem: ML training over non-IID (i.e., not independent and identically distributed) data partitions (e.g., facial images collected by cameras varies according to the demographics of each camera's location).

연구 동기 및 목표

  • 글로벌로 분산되고 급격히 증가하는 데이터에서 기계학습 시스템의 높은 지연 시간과 높은 비용이라는 핵심 과제를 해결한다.
  • 지리적으로 분산된 데이터 센터 간의 통신 오버헤드를 최소화하는 시스템을 설계하여 학습 속도를 향상시키고 운영 비용을 절감한다.
  • 분산 학습 환경에서 비IIDs 데이터 분할로 인한 성능 저하를 극복한다.
  • 지속적으로 증가하는 데이터셋, 예를 들어 영상 스트림과 같은 데이터에 대해 저지연, 저비용 추론을 가능하게 한다.
  • 기계학습 알고리즘, 모델 구조, 데이터 분포의 본질적 특성과 일치하는 시스템 수준의 솔루션을 개발한다.

제안 방법

  • 대규모 영상 데이터셋의 액세스 패턴에 맞춰 데이터 분할 및 캐싱 전략을 적용한 추론 시스템을 설계하여 지연 시간과 대역폭 소비를 최소화한다.
  • 모델 업데이트 압축과 비동기 동기화를 활용하여 교차 데이터 센터 트래픽을 줄이는 통신 최적화 학습 프레임워크를 구현한다.
  • 지리적으로 분산된 노드 간의 데이터 왜곡과 분포 이동에 동적으로 대응할 수 있는 새로운 파라미터 서버 아키텍처를 도입한다.
  • 기기 간 데이터 분포의 통계 모델링을 적용하여 비IIDs 환경에서의 데이터 샤딩과 모델 업데이트 집계를 안내한다.
  • 계층적 집계와 국지성 인식 스케줄링을 활용하여 지리적으로 분산된 학습에서 광역망 통신을 줄인다.
  • 확률적 최적화와 모델 구조 분석에서 도출된 알고리즘적 통찰을 활용하여 불필요한 계산과 통신을 최소화한다.

실험 결과

연구 질문

  • RQ1지속적으로 증가하고 글로벌로 분산된 데이터셋, 예를 들어 영상 스트림과 같은 데이터에 대해 기계학습 추론을 어떻게 저지연, 저비용으로 구현할 수 있는가?
  • RQ2다양한 대륙에 분포한 데이터 센터에서의 분산 학습을 단일 데이터 센터 학습 수준의 속도로 만들 수 있는 시스템 최적화는 무엇인가?
  • RQ3분산 기계학습에서 비IIDs 데이터 분할로 인한 성능 저하를 어떻게 완화할 수 있는가?
  • RQ4데이터 분포 특성이 분산 기계학습에서 효율적인 통신 및 계산 전략을 설계하는 데 어떤 역할을 하는가?
  • RQ5기계학습 모델의 알고리즘적 및 구조적 특성을 활용하는 시스템 설계가 통신 오버헤드를 상당히 줄일 수 있는가?

주요 결과

  • 제안된 추론 시스템은 대규모 영상 추론에서 기준 시스템 대비 지연 시간과 비용을 한 개에서 두 개의 지수 정도 감소시켰다.
  • 지리적으로 분산된 데이터셋에서의 분산 학습 시스템은 광역망 제약 조건에도 불구하고 단일 데이터 센터 학습 수준의 학습 시간을 달성했다.
  • 비IIDs 데이터 분할을 위한 시스템은 기기 간 데이터 분포 왜곡에 대응함으로써 모델 수렴과 정확도를 상당히 향상시켰다.
  • 최적화된 데이터 샤딩과 업데이트 압축 기법을 통해 분산 학습에서의 통신 오버헤드를 최대 90%까지 감소시켰다.
  • 알고리즘적 통찰을 시스템 설계에 통합함으로써 학습 속도와 추론 효율성에서 측정 가능한 향상을 이룩했다.
  • 실증적 평가를 통해 기계학습 모델 및 데이터 특성과 일치하는 시스템 최적화가 실제 운영 환경에서 상당한 성능 향상을 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.