Skip to main content
QUICK REVIEW

[논문 리뷰] Bellamy: Reusing Performance Models for Distributed Dataflow Jobs Across Contexts

Dominik Scheinert, Lauritz Thamsen|arXiv (Cornell University)|2021. 07. 29.
Cloud Computing and Resource Management참고 문헌 36인용 수 17
한 줄 요약

Bellamy는 스케일아웃, 데이터셋 크기 및 기술적 작업 속성과 같은 요소를 포함하여 다양한 실행 환경 간의 성능 데이터를 재사용함으로써 분산 데이터플로우 작업에 대한 블랙박스 런타임 예측 모델을 제안한다. 두 단계의 접근 방식을 사용한다: 먼저 다중 환경 데이터를 기반으로 일반 모델을 훈련한 후, 특정 환경에 맞게 보정한다. 이는 특히 스케일아웃 행동이 비트리비얼한 알고리즘에서 뛰어난 내삽 성능를 달성하며, 사전 훈련된 가중치를 활용해 훈련 속도를 높인다.

ABSTRACT

Distributed dataflow systems enable the use of clusters for scalable data analytics. However, selecting appropriate cluster resources for a processing job is often not straightforward. Performance models trained on historical executions of a concrete job are helpful in such situations, yet they are usually bound to a specific job execution context (e.g. node type, software versions, job parameters) due to the few considered input parameters. Even in case of slight context changes, such supportive models need to be retrained and cannot benefit from historical execution data from related contexts. This paper presents Bellamy, a novel modeling approach that combines scale-outs, dataset sizes, and runtimes with additional descriptive properties of a dataflow job. It is thereby able to capture the context of a job execution. Moreover, Bellamy is realizing a two-step modeling approach. First, a general model is trained on all the available data for a specific scalable analytics algorithm, hereby incorporating data from different contexts. Subsequently, the general model is optimized for the specific situation at hand, based on the available data for the concrete context. We evaluate our approach on two publicly available datasets consisting of execution data from various dataflow jobs carried out in different environments, showing that Bellamy outperforms state-of-the-art methods.

연구 동기 및 목표

  • . 분산 데이터플로우 시스템에서 성능 모델링을 위한 역사적 데이터가 제한된 문제에 대응하고자 한다.
  • . 관련되지만 다른 실행 환경의 데이터를 재사용하여 런타임 예측 정확도를 향상시키고자 한다.
  • . 각 환경당 비용이 많이 드는 프로파일링 또는 광범위한 역사적 데이터에 대한 의존도를 줄이고자 한다.
  • . 사용자가 수동 튜닝에 전문 지식이나 시간이 없어도 클라우드 환경에서 효율적인 자원 구성 지원을 목표로 한다.
  • . 다양한 사용자와 동적인 클라우드 워크로드를 고려한 확장 가능하고 정확하며 빠른 예측을 가능하게 하고자 한다.

제안 방법

  • . Bellamy는 두 단계 모델링 접근 방식을 사용한다: 먼저 다수의 환경에서의 데이터를 기반으로 일반 모델을 훈련한 후, 특정 환경에 맞게 보정한다.
  • . 스케일아웃, 데이터셋 크기 및 추가적인 기술적 작업 및 자원 속성을 입력 특성으로 포함한다.
  • . 모델는 작업별 특화된 구성 요소를 갖춘 신경망으로 구현되어 맥락 인식 예측을 수행한다.
  • . 보정은 사전 훈련된 가중치와 맥락별 데이터의 조합을 사용하며, 로컬, 부분적 언프리즈, 전체 리셋 전략 등의 변형이 있다.
  • . 일반 모델을 최소한의 데이터로 새로운 맥락에 적응시키기 위해 전이 학습 원리를 활용한다.
  • . 조기 정지 및 평균 절대 오차(MAE)와 같은 평가 지표를 사용하여 예측 성능를 평가하고 최적화한다.

실험 결과

연구 질문

  • RQ1. 다양한 실행 환경에서 훈련된 성능 모델이 제한된 데이터로 새로운 특정 환경에 효과적으로 일반화될 수 있는가?
  • RQ2. 스케일아웃과 데이터셋 크기 외에 기술적 작업 및 자원 속성을 포함함으로써 런타임 예측 정확도가 향상되는가?
  • RQ3. Bellamy의 교차 환경 학습 능력은 예측 정확도와 훈련 효율성 측면에서 최신 기술 대비 어떻게 비교되는가?
  • RQ4. 로컬, 전체 리셋 등 다양한 보정 전략(예: 로컬, 전체 리셋)이 모델 성능과 훈련 시간에 어떤 영향을 미치는가?
  • RQ5. 스케일아웃 행동이 비트리비얼한 알고리즘(특히 PageRank 등)에 대해 데이터가 부족한 상황에서도 Bellamy가 효과적으로 런타임을 예측할 수 있는가?

주요 결과

  • . Bellamy는 PageRank와 같이 스케일아웃 행동이 비트리비얼한 알고리즘에서 최신 기술 대비 런타임 예측에서 뛰어난 성능를 보였다.
  • . Bellamy의 로컬 변종은 Grep, PageRank, SGD 등 모든 평가된 알고리즘에서 가장 높은 평균 예측 성능를 달성했다.
  • . 사전 훈련된 가중치 기반 모델은 평균 훈련 시간을 로컬 변종의 9.4초에서 2.8~3.8초로 줄여 훈련 과정을 크게 가속화했다.
  • . 사전 훈련된 Bellamy 모델는 더 빠르게 수렴하고 보정 훈련을 조기에 종료하여 훈련 효율성이 향상됨을 보였다.
  • . 맥락 간 내삽에 효과적으로 대응할 수 있었으며, 다양한 환경 간 모델 재사용 시 뚜렷한 성능 향상이 관찰되었다.
  • . 선형적 스케일아웃 행동을 보이는 알고리즘(예: 선형)의 경우 Bellamy가 항상 단순 기준 모델을 초월하지는 않았다. 이는 Bellamy의 장점이 복잡한 스케일링 패턴에서 두드러짐을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.