Skip to main content
QUICK REVIEW

[논문 리뷰] DV-ARPA: Data Variety Aware Resource Provisioning for Big Data Processing in Accumulative Applications

Hossein Ahmadvand, Fouzhan Foroutan|arXiv (Cornell University)|2020. 08. 11.
Cloud Computing and Resource Management참고 문헌 14인용 수 11
한 줄 요약

DV-ARPA는 누적 응용 프로그램에서 대용량 데이터 워크로드를 위한 데이터 다양성 인지 자원 할당 프레임워크를 제안하며, 표본 기반 분석을 통해 유도된 데이터 블록의 중요도에 기반해 동적으로 VM을 할당합니다. 데이터 특성에 맞는 VM 유형을 매핑함으로써, 데이터 다양성 무시 전략 대비 처리 비용을 최대 35% 감소시킵니다.

ABSTRACT

In Cloud Computing, the resource provisioning approach used has a great impact on the processing cost, especially when it is used for Big Data processing. Due to data variety, the performance of virtual machines (VM) may differ based on the contents of the data blocks. Data variety-oblivious allocation causes a reduction in the performance of VMs and increases the processing cost. Thus, it is possible to reduce the total cost of the job by matching the VMs with the given data blocks. We use a data-variety-aware resource allocation approach to reduce the processing cost of the considered job. For this issue, we divide the input data into some data blocks. We define the significance of each data block and based on it we choose the appropriate VMs to reduce the cost. For detecting the significance of each data portion, we use a specific sampling method. This approach is applicable to accumulative applications. We use some well-known benchmarks and configured servers for our evaluations. Based on the results, our provisioning approach improves the processing cost, up to 35% compared to other approaches.

연구 동기 및 목표

  • 데이터 다양성이 VM 성능에 영향을 주어 클라우드 기반 대용량 데이터 워크로드의 처리 비용이 높아지는 문제를 해결하기 위해.
  • 일관된 할당을 사용하는 대신 데이터 블록 특성에 맞는 VM 유형을 매칭시켜 자원 할당 오버헤드를 줄이기 위해.
  • 데이터가 점진적으로 처리되는 누적 응용 프로그램에서 데이터 다양성 분석을 통해 비용 효율성을 향상시키기 위해.
  • 실제 대용량 데이터 벤치마크에 적용 가능한 확장 가능한 데이터 다양성 인지 할당 전략을 개발하기 위해.
  • 중요도 인지 기반 VM 할당이 클라우드 환경에서 측정 가능한 비용 절감을 이끌어내는지 입증하기 위해.

제안 방법

  • 대용량 데이터를 세분화된 데이터 블록으로 나누어 정밀한 분석을 수행합니다.
  • 특정 표본 추출 방법을 적용하여 데이터 블록의 내용과 처리 특성에 기반해 각 블록의 중요도를 추정합니다.
  • 데이터 블록의 중요도를 적절한 VM 유형에 매핑하여 성능과 비용을 최적화합니다.
  • VM 유형, 데이터 다양성, 처리 부하를 고려한 비용 모델을 사용하여 할당 결정을 안내합니다.
  • 실제 조건에서 평가하기 위해 잘 알려진 대용량 데이터 벤치마크와 구성된 클라우드 서버를 활용합니다.
  • 누적 처리 단계 동안 데이터 다양성에 적응하는 피드백 기반의 할당 메커니즘을 구현합니다.

실험 결과

연구 질문

  • RQ1데이터 다양성이 대용량 데이터 워크로드에서 VM 성능과 처리 비용에 어떤 영향을 미치는가?
  • RQ2데이터 블록 중요도에 기반한 동적 VM 할당이 총 처리 비용을 줄일 수 있는가?
  • RQ3누적 응용 프로그램에서 데이터 다양성 인지 할당이 데이터 다양성 무시 할당에 비해 어느 정도 뛰어난가?
  • RQ4어떤 표본 추출 전략이 데이터 블록 중요도의 정확하고 효율적인 추정을 가능하게 하는가?
  • RQ5제안된 할당 모델은 다양한 대용량 데이터 워크로드에서 얼마나 확장 가능하고 효과적인가?

주요 결과

  • DV-ARPA 접근 방식은 기존의 데이터 다양성 무시 전략에 비해 총 처리 비용을 최대 35%까지 감소시킵니다.
  • 데이터 다양성이 VM 성능에 크게 영향을 미치며, 부적절한 VM 할당은 더 높은 처리 비용을 초래합니다.
  • 표본 기반 중요도 탐지 방법은 성능이 높은 VM이 필요한 데이터 블록을 효과적으로 식별합니다.
  • 데이터 특성이 시간이 지남에 따라 변화하는 누적 워크로드에서 비용 절감 효과가 가장 두드러집니다.
  • 제안된 방법은 여러 벤치마크 워크로드를 통해 높은 효율성과 확장성을 유지합니다.
  • 데이터 중요도 기반 VM 할당은 대용량 데이터 파이프라인에서 더 나은 자원 활용도와 낮은 지연 시간을 달성합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.