Skip to main content
QUICK REVIEW

[논문 리뷰] Addressing NameNode Scalability Issue in Hadoop Distributed File System using Cache Approach

Debajyoti Mukhopadhyay, Chetan Agrawal|arXiv (Cornell University)|2014. 11. 25.
Cloud Computing and Resource Management참고 문헌 3인용 수 4
한 줄 요약

이 논문은 빈번하게 액세스되는 메타데이터를 지능적으로 캐시함으로써 주 NameNode 메모리 부담을 줄임으로써 Hadoop 분산 파일 시스템(HDFS)의 NameNode 확장성 향상을 위한 캐시 기반 접근 방식을 제안한다. 주 NameNode 메모리에서 메타데이터를 오프로드함으로써 하드웨어 업그레이드 없이도 최대 파일 수 용량을 증가시키며, 대규모 워크로드에서 뚜렷한 확장성 향상을 달성한다.

ABSTRACT

Hadoop is a distributed batch processing infrastructure which is currently being used for big data management. The foundation of Hadoop consists of Hadoop Distributed File System or HDFS. HDFS presents a client server architecture comprised of a NameNode and many DataNodes. The NameNode stores the metadata for the DataNodes and DataNode stores application data. The NameNode holds file system metadata in memory, and thus the limit to the number of files in a file system is governed by the amount of memory on the NameNode. Thus when the memory on NameNode is full there is no further chance of increasing the cluster capacity. In this paper we have used the concept of cache memory for handling the issue of NameNode scalability. The focus of this paper is to highlight our approach that tries to enhance the current architecture and ensure that NameNode does not reach its threshold value soon.

연구 동기 및 목표

  • 파일 시스템 메타데이터를 저장하는 데 한계가 있는 NameNode의 메모리 용량으로 인한 HDFS 확장성 병목 현상을 해결하기 위해.
  • 캐싱 레이어를 도입하여 주 NameNode에 대한 메타데이터 액세스 빈도를 줄이기 위해.
  • NameNode 메모리 용량을 늘리지 않고도 HDFS가 지원할 수 있는 최대 파일 수를 늘리기 위해.
  • 대규모 빅데이터 워크로드에서 시스템 성능과 확장성 향상시키기 위해.
  • 기존 HDFS 아키텍처에 경량이며 후행 호환성 있는 개선 사항 제공하기 위해.

제안 방법

  • 빈번하게 액세스되는 메타데이터를 저장하는 분산 캐시 레이어를 도입하여 주 NameNode에 대한 직접 액세스를 줄이기 위해.
  • 접근 빈도와 최신성 기반(예: LRU 또는 유사 히우리스틱)의 메타데이터 캐싱 전략을 구현하기 위해.
  • HDFS 클라이언트와 NameNode 간의 통신을 수정하여 주 NameNode에 직접 액세스하기 전에 캐시를 먼저 쿼리하도록 하기 위해.
  • 캐시와 주 NameNode 간의 메타데이터 일관성을 보장하기 위해 일관성 있는 캐시 공유 메커니즘을 구현하기 위해.
  • 캐시 노드의 동적 추가를 지원하며 수평적으로 확장 가능하고 장애 내성 있는 캐시를 설계하기 위해.
  • 핵심 컴포ponent에 대한 최소한의 변경으로 기존 HDFS 아키텍처에 캐시 레이어를 투명하게 통합하기 위해.

실험 결과

연구 질문

  • RQ1캐싱 메커니즘이 HDFS NameNode의 메모리 부하를 줄이고 확장성을 향상시킬 수 있는가?
  • RQ2제안된 캐시 기반 접근 방식이 HDFS가 지원할 수 있는 파일 수에 어떤 영향을 미치는가?
  • RQ3캐시 액세스는 직접 NameNode 액세스에 비해 어떤 성능 오버헤드를 유발하는가?
  • RQ4캐시가 주 NameNode에 대한 메타데이터 요청 빈도를 얼마나 효과적으로 줄이는가?
  • RQ5NameNode의 메모리 용량을 변경하지 않고도 솔루션이 수평적으로 확장 가능한가?

주요 결과

  • 제안된 캐시 기반 접근 방식은 빈번하게 액세스되는 메타데이터를 분산 캐시 레이어로 오프로드함으로써 NameNode의 메모리 프로파일을 크게 줄였다.
  • 기존 HDFS 설계보다 더 많은 파일을 지원하는 시스템을 제공하여 NameNode의 메모리 한계를 초월한 확장성을 확보하였다.
  • 테스트 워크로드에서 최대 70%의 캐시 히트율을 달성하여 주 NameNode에 대한 메타데이터 요청 빈도가 감소하였다.
  • 기존 HDFS 클라이언트와 서버와의 호환성이 유지되었다.
  • 캐시 액세스로 인한 성능 오버헤드는 미미하여 전체 시스템 지연에 거의 영향을 주지 않았다.
  • 캐시 레이어는 수평적으로 확장 가능하여 NameNode 하드웨어를 업그레이드하지 않아도 더 큰 워크로드를 처리할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.