Skip to main content
QUICK REVIEW

[논문 리뷰] Fault Tolerance in Iterative-Convergent Machine Learning

Aurick Qiao, Bryon Aragam|arXiv (Cornell University)|2018. 10. 17.
Stochastic Gradient Optimization Techniques인용 수 14
한 줄 요약

이 논문은 반복 수렴형 기계학습 알고리즘에서의 변동 요인의 반복 비용을 정량화하기 위한 일반적 프레임워크를 제안한다. 이는 더 스마트한 체크포인트 기반 장애 내성 기능을 가능하게 한다. 복구 시 변동 요인의 크기를 최소화함으로써, 다양한 모델과 알고리즘에서 기존 방법 대비 SCAR 시스템은 재작업을 78%~95% 감소시킨다.

ABSTRACT

Machine learning (ML) training algorithms often possess an inherent self-correcting behavior due to their iterative-convergent nature. Recent systems exploit this property to achieve adaptability and efficiency in unreliable computing environments by relaxing the consistency of execution and allowing calculation errors to be self-corrected during training. However, the behavior of such systems are only well understood for specific types of calculation errors, such as those caused by staleness, reduced precision, or asynchronicity, and for specific types of training algorithms, such as stochastic gradient descent. In this paper, we develop a general framework to quantify the effects of calculation errors on iterative-convergent algorithms and use this framework to design new strategies for checkpoint-based fault tolerance. Our framework yields a worst-case upper bound on the iteration cost of arbitrary perturbations to model parameters during training. Our system, SCAR, employs strategies which reduce the iteration cost upper bound due to perturbations incurred when recovering from checkpoints. We show that SCAR can reduce the iteration cost of partial failures by 78% - 95% when compared with traditional checkpoint-based fault tolerance across a variety of ML models and training algorithms.

연구 동기 및 목표

  • 임의의 변동 요인이 반복 수렴형 기계학습 훈련 알고리즘에 미치는 영향을 정량화하기 위한 일반적 프레임워크를 개발하는 것.
  • 하드웨어 장애, 지연, 저정밀도 계산 등으로 인한 변동 요인이 수렴성과 반복 비용에 어떻게 영향을 미치는지 이해하는 것.
  • 복구 후 재작업을 최소화하기 위해 변동 요인 크기를 최소화하는 체크포인트 기반 장애 내성 전략을 설계하는 것.
  • SCAR를 구현하고 평가함으로써, 향상된 장애 내성 효율성을 위한 새로운 전략을 적용한 파라미터 서버 시스템을 개발하는 것.

제안 방법

  • 프레임워크는 변동 요인 크기와 알고리즘 수렴 성질에 기반해 반복 비용의 최악의 경우 상한을 유도한다.
  • 변동 요인은 모델 파라미터의 이탈로 모델링하고, 수렴 가정을 사용해 복구에 필요한 추가 반복 수를 제한한다.
  • SCAR는 부분 체크포인트 및 우선순위 기반 체크포인트를 사용해 복구 시 변동 요인의 크기를 줄인다.
  • 체크포인트 결정을 안내하고 재작업을 최소화하기 위해 수렴 파라미터를 실시간으로 추정한다.
  • 이론적 분석은 표준 수렴 조건, 즉 리프시츠 연속성과 강력 볼록성을 가정하여 상한을 유도한다.
  • SCAR는 다양한 기계학습 모델(예: LDA, 로지스틱 회귀)과 훈련 알고리즘(예: SGD)을 대상으로 평가되어 일관된 성능 향상이 나타났다.

실험 결과

연구 질문

  • RQ1반복 수렴형 기계학습 알고리즘에서 임의의 변동 요인이 초래하는 최악의 반복 비용은 무엇인가?
  • RQ2체크포인트 기반 장애 내성 전략을 어떻게 재설계하여 변동 요인 크기를 최소화하고 재작업을 줄일 수 있는가?
  • RQ3변동 인지 체크포인트 전략은 분산 훈련에서 부분 장애의 반복 비용을 상당히 줄일 수 있는가?
  • RQ4기계학습 알고리즘의 자가정규화 행동은 기존의 체크포인트-재시작 방식보다 더 효율적인 장애 내성 기능을 어떻게 가능하게 하는가?
  • RQ5변동 영향에 대한 이론적 상한은 기계학습 훈련에서 실시간 시스템 결정을 얼마나 잘 이끌 수 있는가?

주요 결과

  • SCAR는 다양한 모델과 알고리즘에서 기존의 체크포인트-재시작 메커니즘 대비 부분 장애의 반복 비용을 78%~95% 감소시켰다.
  • ClueWeb에서 LDA 훈련을 수행한 결과, SCAR는 기존 복구 방식보다 동일한 가능도 값을 3회 반복 이른 시점에 도달하여 약 6분의 재작업 시간을 절감했다.
  • 매 4회 반복마다 약 13초의 추가 오버헤드가 발생함에도 불구하고, 부분 체크포인트와 우선순위 기반 전략 덕분에 네트워크 성능 향상이 달성되었다.
  • 이론적 분석 결과, 표준 수렴 조건 하에서 반복 비용은 변동 요인 크기와 최적점까지의 초기 거리의 함수로 상한이 존재함을 보여주었다.
  • 우선순위 기반 부분 체크포인트는 복구 시 도입되는 변동 요인의 크기를 상당히 줄여 재작업을 직접적으로 감소시켰다.
  • 프레임워크는 수렴 파라미터인 c와 ||x^(0) - x*||를 실시간으로 근사함으로써 예측 기반 시스템 결정을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.