Skip to main content
QUICK REVIEW

[논문 리뷰] A Time-driven Data Placement Strategy for a Scientific Workflow Combining Edge Computing and Cloud Computing

Bing Lin, Fangning Zhu|arXiv (Cornell University)|2019. 01. 22.
IoT and Edge/Fog Computing참고 문헌 35인용 수 11
한 줄 요약

이 논문은 엣지와 클라우드 컴퓨팅을 융합한 과학 워크플로우에서 데이터 전송 지연을 최소화하기 위해 자기적응형 GA-DPSO 알고리즘을 사용하는 시간 기반 데이터 배치 전략을 제안한다. 유전 알고리즘 연산자(교배 및 돌연변이)를 입자군집최적화에 통합함으로써 인구 다양성을 향상시키고 조기 수렴을 줄이며, 제약 조건이 있는 엣지 스토리지 용량을 가진 이질적인 데이터센터 간에 데이터 전송 시간을 크게 감소시킨다.

ABSTRACT

Compared to traditional distributed computing environments such as grids, cloud computing provides a more cost-effective way to deploy scientific workflows. Each task of a scientific workflow requires several large datasets that are located in different datacenters from the cloud computing environment, resulting in serious data transmission delays. Edge computing reduces the data transmission delays and supports the fixed storing manner for scientific workflow private datasets, but there is a bottleneck in its storage capacity. It is a challenge to combine the advantages of both edge computing and cloud computing to rationalize the data placement of scientific workflow, and optimize the data transmission time across different datacenters. Traditional data placement strategies maintain load balancing with a given number of datacenters, which results in a large data transmission time. In this study, a self-adaptive discrete particle swarm optimization algorithm with genetic algorithm operators (GA-DPSO) was proposed to optimize the data transmission time when placing data for a scientific workflow. This approach considered the characteristics of data placement combining edge computing and cloud computing. In addition, it considered the impact factors impacting transmission delay, such as the band-width between datacenters, the number of edge datacenters, and the storage capacity of edge datacenters. The crossover operator and mutation operator of the genetic algorithm were adopted to avoid the premature convergence of the traditional particle swarm optimization algorithm, which enhanced the diversity of population evolution and effectively reduced the data transmission time. The experimental results show that the data placement strategy based on GA-DPSO can effectively reduce the data transmission time during workflow execution combining edge computing and cloud computing.

연구 동기 및 목표

  • 엣지와 클라우드 데이터센터를 포함하는 과학 워크플로우에서 높은 데이터 전송 지연 문제를 해결하기 위해.
  • 엣지 컴퓨팅의 저지연 특성과 클라우드 컴퓨팅의 확장 가능한 스토리지 능력을 활용하여 데이터 배치를 최적화하기 위해.
  • 기존 데이터 배치 전략이 부하 균형을 효과적으로 유지하지 못하고 전송 시간을 최소화하지 못하는 한계를 극복하기 위해.
  • 하이브리드 엣지-클라우드 환경의 네트워크 및 스토리지 제약 조건에 동적으로 적응할 수 있는 자기적응형 최적화 알고리즘을 개발하기 위해.

제안 방법

  • 자기적응형 이산 입자군집최적화(DPSO) 알고리즘에 유전 알고리즘(GA) 연산자인 교배 및 돌연변이를 통합하여 인구 다양성을 향상시키고 조기 수렴을 방지한다.
  • 알고리즘은 각 입자가 엣지 및 클라우드 데이터센터 간 잠재적 데이터 배치 구성으로 모델링되는 이산 최적화 문제로 데이터 배치 결정을 처리한다.
  • 전송 지연은 데이터센터 간 대역폭, 엣지 데이터센터 수, 엣지 스토리지 용량 제약 조건의 함수로 모델링된다.
  • 적합도 함수는 총 데이터 전송 시간을 기반으로 데이터 배치 구성의 성능을 평가하며, 워크플로우 종료까지의 전체 실행 지연을 최소화하는 것을 목표로 한다.
  • 알고리즘은 국소 최적 및 전역 최적 해를 기반으로 하이브리드 학습 규칙을 사용하여 입자의 위치와 속도를 반복적으로 갱신한다.
  • 실제 네트워크 및 스토리지 제약 조건 하에서 평가되며, 과학 워크플로우를 위한 하이브리드 엣지-클라우드 인프라를 시뮬레이션한다.

실험 결과

연구 질문

  • RQ1하이브리드 엣지-클라우드 환경에서 과학 워크플로우의 데이터 전송 지연을 최소화하기 위해 데이터 배치를 어떻게 최적화할 수 있는가?
  • RQ2대역폭, 엣지 데이터센터 수, 엣지 스토리지 용량은 데이터 전송 시간에 어떤 영향을 미치는가?
  • RQ3입자군집최적화에 유전 알고리즘 연산자를 통합하면 데이터 배치 문제에서 수렴 행동과 해의 품질을 향상시킬 수 있는가?
  • RQ4제안된 GA-DPSO 전략은 전통적인 데이터 배치 방법과 비교해 전송 시간과 부하 균형 측면에서 어떻게 성능을 발휘하는가?
  • RQ5알고리즘의 자기적응적 특성은 네트워크 및 스토리지 조건의 동적 변화에 얼마나 잘 대응할 수 있는가?

주요 결과

  • 기존의 로드 밸런싱 접근 방식에 비해 GA-DPSO 기반 데이터 배치 전략이 데이터 전송 시간을 크게 감소시킨다.
  • DPSO에 교배 및 돌연변이 연산자를 통합함으로써 인구 다양성이 향상되고 조기 수렴이 방지되어 더 나은 최적화 성능을 달성한다.
  • 알고리즘은 엣지 데이터센터의 스토리지 용량 제약 조건을 효과적으로 처리하면서도 장거리 클라우드 연결 간의 데이터 전송을 최소화한다.
  • 자주 액세스되는 데이터셋을 처리 노드에 가까이 배치함으로써 종료까지의 워크플로우 실행 시간을 낮춘다.
  • 실험 결과는 제안된 전략이 다양한 네트워크 및 스토리지 조건 하에서 기준 방법에 비해 전송 시간 단축 측면에서 뛰어난 성능을 보임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.