[논문 리뷰] Support vector regression model for BigData systems
이 논문은 대규모 데이터 시스템에서 MapReduce 작업의 실행 시간을 예측하기 위해 지지 벡터 회귀(SVR) 모델을 제안한다. 기계 학습을 활용해 시뮬레이션 기반 모델의 계산 비용 문제를 해결한다. SVR는 대부분의 경우 선형 회귀보다 우수하며, 특히 노이즈가 많은 데이터에서 뛰어난 성능을 보이며, 핵심 수(1/nCores)를 핵심 특성으로 사용할 경우 최적의 구성에서 상대 오차가 10% 이하로 낮아진다.
Nowadays Big Data are becoming more and more important. Many sectors of our economy are now guided by data-driven decision processes. Big Data and business intelligence applications are facilitated by the MapReduce programming model while, at infrastructural layer, cloud computing provides flexible and cost effective solutions for allocating on demand large clusters. In such systems, capacity allocation, which is the ability to optimally size minimal resources for achieve a certain level of performance, is a key challenge to enhance performance for MapReduce jobs and minimize cloud resource costs. In order to do so, one of the biggest challenge is to build an accurate performance model to estimate job execution time of MapReduce systems. Previous works applied simulation based models for modeling such systems. Although this approach can accurately describe the behavior of Big Data clusters, it is too computationally expensive and does not scale to large system. We try to overcome these issues by applying machine learning techniques. More precisely we focus on Support Vector Regression (SVR) which is intrinsically more robust w.r.t other techniques, like, e.g., neural networks, and less sensitive to outliers in the training set. To better investigate these benefits, we compare SVR to linear regression.
연구 동기 및 목표
- Hadoop 및 Tez 시스템에서 대규모 데이터 작업의 실행 시간을 정확하게 예측하는 데 도전한다.
- 스케일이 클 경우 시뮬레이션 기반 성능 모델링의 계산 비용이 지나치게 높아져 실현 불가능한 문제를 해결한다.
- 확장 가능하고 정확한 성능 예측을 위해 기계 학습 기법—특히 선형 회귀와 SVR—을 평가한다.
- 클러스터 크기와 작업 특성의 맥락에서 SVR에 가장 효과적인 특성과 커널 유형을 규명한다.
- 클라우드 기반 대규모 데이터 시스템에서 비용 효율적이고 효율적인 용량 할당을 가능하게 한다.
제안 방법
- 작업 실행 시간을 모델링하기 위해 선형, 다항식(차수 2 및 3), 가우시안(RBF) 커널을 사용한 지지 벡터 회귀(SVR)를 적용한다.
- 특성 공학을 통해 관련된 작업 및 클러스터 특성을 추출하며, 1/nCores가 높은 예측 능력을 보이는 특성으로 확인된다.
- 도메인 전문 지식 기반의 MapReduce 모델과 기계 학습을 융합한 그레이박스 접근 방식을 통해 특성 선택을 유도한다.
- 실제 Hadoop 및 Tez 워크로드에서의 실행 데이터를 사용해 SVR과 선형 회귀를 비교한다.
- 편향과 분산의 균형을 확보하기 위해 교차 검증을 통해 SVR의 하이퍼파라미터를 최적화한다.
- 다양한 클러스터 크기(20코어)에서 여러 쿼리 워크로드(예: Q2, Q3, Q4)를 대상으로 모델을 검증한다.
실험 결과
연구 질문
- RQ1SVR는 대규모 데이터 워크로드에서 선형 회귀보다 더 정확한 실행 시간 예측을 제공할 수 있는가?
- RQ2다양한 SVR 커널 유형(다항식, 가우시안) 간에 작업 완료 시간 예측 성능는 어떻게 비교되는가?
- RQ3Hadoop 및 Tez 시스템에서 실행 시간 예측에 가장 유용한 작업 및 클러스터 특성들은 무엇인가?
- RQ4코어 수의 역수(1/nCores)는 성능 모델링에 더 뛰어난 특성으로 기능하는가?
- RQ5이력 데이터 기반 기계 학습 모델은 클라우드 기반 대규모 데이터 시스템에서 확장 가능하고 비용 효율적인 용량 계획을 가능하게 하는가?
주요 결과
- SVR는 모든 테스트 워크로드(Q2, Q3, Q4)에서 선형 회귀보다 일관되게 뛰어난 성능을 보이며, 평균 상대 오차가 낮았다.
- 가우시안 및 다항식 SVR 커널은 각각 Q2에서 4.01%, Q3에서 22.14%, Q4에서 42.43%의 평균 오차를 기록했다.
- 선형 회귀는 고분산 또는 노이즈가 많은 조건에서 여러 경우에서 수렴하지 못했다.
- 1/nCores 특성이 가장 뛰어난 예측 성능를 보이며, 모든 비선형 SVR 변형보다 뛰어났다.
- 가장 우수한 성능을 보인 모델은 Q2에서 상대 오차 3.10%를 기록하여 클러스터 크기 예측의 높은 정밀도를 입증했다.
- AROMA 유사 시스템은 SVR을 활용해 약 12%의 평균 오차로 완료 시간을 추정할 수 있으며, SLA 준수를 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.