Skip to main content
QUICK REVIEW

[논문 리뷰] Bandwidth-Aware Scheduling with SDN in Hadoop: A New Trend for Big Data

Peng Qin, Bin Dai|arXiv (Cornell University)|2014. 03. 12.
Cloud Computing and Resource Management참고 문헌 8인용 수 12
한 줄 요약

이 논문은 Hadoop와 소프트웨어 정의 네트워킹(SDN)을 통합하여 작업 완료 시간을 최적화하는 대역폭 인지 작업 스케줄러인 BASS를 제안한다. SDN의 중앙 집중식 제어를 활용해 동적 대역폭 할당과 데이터 로컬리티 및 가용 네트워크 용량을 기반으로 한 지능적인 작업 할당을 통해 BASS는 최신 스케줄러인 BAR와 HDS보다 최대 18% 빠른 작업 완료 시간을 달성하며, 확장 가능한 대용량 데이터 처리의 새로운 추세를 보여준다.

ABSTRACT

Software Defined Networking (SDN) is a revolutionary network architecture that separates out network control functions from the underlying equipment and is an increasingly trend to help enterprises build more manageable data centers where big data processing emerges as an important part of applications. To concurrently process large-scale data, MapReduce with an open source implementation named Hadoop is proposed. In practical Hadoop systems one kind of issue that vitally impacts the overall performance is know as the NP-complete minimum make span problem. One main solution is to assign tasks on data local nodes to avoid link occupation since network bandwidth is a scarce resource. Many methodologies for enhancing data locality are proposed such as the HDS and state-of-the-art scheduler BAR. However, all of them either ignore allocating tasks in a global view or disregard available bandwidth as the basis for scheduling. In this paper we propose a heuristic bandwidth-aware task scheduler BASS to combine Hadoop with SDN. It is not only able to guarantee data locality in a global view but also can efficiently assign tasks in an optimized way. Both examples and experiments demonstrate that BASS has the best performance in terms of job completion time. To our knowledge, BASS is the first to exploit talent of SDN for big data processing and we believe it points out a new trend for large-scale data processing.

연구 동기 및 목표

  • Hadoop 클러스터에서 네트워크 대역폭과 자원 경쟁으로 인해 제약을 받는 NP-완전 최소 메이크스팬 문제를 해결하기 위해.
  • 기존 스케줄러인 HDS와 BAR와 같은 한계를 극복하기 위해, 전반적인 대역폭 가용성이나 동적 네트워크 조건을 고려하지 않는 데이터 로컬리티 우선 전략을 개선하기 위해.
  • SDN의 중앙 집중식 제어와 프로그래머블성을 활용해 대용량 데이터 워크로드에서 성능을 향상시키는 대역폭 인지 스케줄링 프레임워크를 설계하기 위해.
  • 다양한 워크로드와 네트워크 조건에서 실제 Hadoop 환경에서 제안된 스케줄러의 효과성을 평가하기 위해.

제안 방법

  • 네트워크 시간을 간격으로 나누어 링크 이용률을 관리하고 예측 가능한 스케줄링을 보장하기 위해 대역폭 할당을 위한 타임슬롯(TS) 기반 기법을 제안한다.
  • 예상 완료 시간을 고려해 로컬 및 원격 실행을 기반으로 작업 할당을 평가하는 히우리스틱 스케줄러인 BASS(Bandwidth-Aware Scheduling with SDN in Hadoop)를 도입한다.
  • 작업 진행률과 잔여 시간을 추정하기 위해 ProgressRate 기법을 사용하여 실시간 노드 대기 시간과 네트워크 가용성을 기반으로 동적 스케줄링 결정을 가능하게 한다.
  • SDN 컨트롤러를 통합해 네트워크 대역폭을 모니터링하고 제어하며, OpenFlow를 사용해 대역폭 예약을 강제하고 작업 스케줄링 중 데이터 전송을 최적화한다.
  • 하이브리드 결정 논리 구현: 로컬 실행이 가능하고 빠를 경우 로컬로 할당; 그렇지 않으면 대역폭이 충분하고 전체 완료 시간이 향상될 경우에만 원격 노드로 오프로드한다.
  • 6개 노드, 2개의 Open vSwitch, 100Mbps 링크를 갖춘 실제 Hadoop 클러스터를 사용해 Wordcount 및 Sort 워크로드를 대상으로 스케줄러를 검증한다.

실험 결과

연구 질문

  • RQ1SDN의 중앙 집중식 대역폭 제어 기능이 Hadoop 클러스터에서 작업 완료 시간 향상에 효과적으로 활용될 수 있는가?
  • RQ2작업 스케줄링에 네트워크 대역폭 인지 기능을 통합할 경우, 기존의 로컬리티 중심 스케줄러와 비교해 데이터 로컬리티와 전체 성능에 어떤 영향을 미치는가?
  • RQ3다양한 워크로드 하에서 최신 스케줄러인 BAR와 HDS보다 대역폭 인지 스케줄러가 작업 완료 시간 측면에서 뛰어난가?
  • RQ4대규모 데이터 처리에서 데이터 로컬리티와 네트워크 대역폭 활용 간의 상호 갈등은 무엇이며, 이를 어떻게 최적화할 수 있는가?

주요 결과

  • BASS는 모든 테스트 워크로드에서 가장 낮은 작업 완료 시간을 기록했으며, BAR 대비 최대 18%, HDS 대비 최대 19%의 메이크스팬 감소를 달성했다.
  • 600MB Wordcount 작업의 경우, BASS는 231초에 완료되었고, BAR(259초)와 HDS(269초)를 모두 앞섰다. 이는 낮은 데이터 로컬리티 비율(58.3% vs. 66.7% 및 83.3%)에도 불구하고 성능이 뛰어났음을 의미한다.
  • 5GB Sort 작업에서는 BASS가 1572초에 완료되었고, BAR는 1632초, HDS는 1859초였으며, 이는 일관된 성능 우월성을 보여준다.
  • 결과는 대역폭 가용성이 데이터 로컬리티보다 성능에 더 큰 영향을 미칠 수 있음을 시사한다. 로컬 노드가 CPU 자원으로 제한될 경우, 충분한 대역폭을 확보한 원격 실행이 더 빠른 완료를 이끈다.
  • BASS는 CPU 집약적(Wordcount) 및 I/O 집약적(Sort) 워크로드를 포함한 다양한 워크로드에서 높은 성능를 유지하며, 그 적응성과 유연성을 입증한다.
  • 본 연구는 SDN을 통한 실시간 대역폭 모니터링 및 제어 통합이 대용량 데이터 스케줄링의 새로운 패러다임을 가능하게 하며, BASS가 Hadoop 환경에서 이 기능을 처음으로 완전히 활용한 스케줄러임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.