[논문 리뷰] HPDedup: A Hybrid Prioritized Data Deduplication Mechanism for Primary Storage in the Cloud
HPDedup는 클라우드 프라이머리 스토리지에서 일괄 처리 지연 시간을 최소화하면서 정확한 디드업리케이션을 달성하기 위해 인라인 지문 캐시와 후처리 디드업리케이션을 결합한 하이브리드 우선순위 기반 디드업리케이션 메커니즘을 제안한다. 다중 테넌트 VM 환경에서 시간적 국소성을 동적으로 추정하고 예측된 중복 빈도에 따라 캐시를 할당함으로써, HPDedup는 인라인 캐시 효율성을 최대 39.70% 향상시키고, 최첨단 기법 대비 피크 스토리지 사용량을 최대 45.08% 감소시킨다.
Eliminating duplicate data in primary storage of clouds increases the cost-efficiency of cloud service providers as well as reduces the cost of users for using cloud services. Existing primary deduplication techniques either use inline caching to exploit locality in primary workloads or use post-processing deduplication running in system idle time to avoid the negative impact on I/O performance. However, neither of them works well in the cloud servers running multiple services or applications for the following two reasons: Firstly, the temporal locality of duplicate data writes may not exist in some primary storage workloads thus inline caching often fails to achieve good deduplication ratio. Secondly, the post-processing deduplication allows duplicate data to be written into disks, therefore does not provide the benefit of I/O deduplication and requires high peak storage capacity. This paper presents HPDedup, a Hybrid Prioritized data Deduplication mechanism to deal with the storage system shared by applications running in co-located virtual machines or containers by fusing an inline and a post-processing process for exact deduplication. In the inline deduplication phase, HPDedup gives a fingerprint caching mechanism that estimates the temporal locality of duplicates in data streams from different VMs or applications and prioritizes the cache allocation for these streams based on the estimation. HPDedup also allows different deduplication threshold for streams based on their spatial locality to reduce the disk fragmentation. The post-processing phase removes duplicates whose fingerprints are not able to be cached due to the weak temporal locality from disks. Our experimental results show that HPDedup clearly outperforms the state-of-the-art primary storage deduplication techniques in terms of inline cache efficiency and primary deduplication efficiency.
연구 동기 및 목표
- 공동 배치된 VM 또는 컨테이너를 포함한 다중 테넌트 워크로드에서 시간적 국소성이 약한 경우 발생하는 클라우드 프라이머리 스토리지의 낮은 디드업리케이션 효율성 문제를 해결한다.
- 순수한 인라인 캐싱의 한계(낮은 국소성 스트림에서 낭비되는 캐시 공간)와 순수한 후처리 디드업리케이션의 한계(높은 피크 스토리지 사용량과 I/O 오버헤드)를 극복한다.
- 다양한 응용 프로그램에서 유입되는 데이터 스트림의 시간적 국소성을 추정하고 이를 바탕으로 캐시 할당을 우선순위화하여 인라인 디드업리케이션의 캐시 활용도를 향상시킨다.
- 공간적 국소성에 기반한 응용 프로그램별 디드업리케이션 임계값을 적용하여 디스크 분할을 줄이고 디드업리케이션 효율성을 향상시킨다.
- 인라인 및 후처리 단계를 효과적으로 융합함으로써 프라이머리 스토리지에서 정확한 디드업리케이션을 달성하면서 성능 영향을 최소화한다.
제안 방법
- 다양한 VM 또는 응용 프로그램에서 유입되는 데이터 스트림의 중복 빈도를 예측하기 위한 동적 시간적 국소성 추정 알고리즘을 도입한다.
- 추정된 국소성을 바탕으로 지문 캐시 할당을 우선순위화하여 중복 빈도가 높은 스트림을 우선 대상으로 한다.
- 공간적 국소성에 따라 각 데이터 스트림에 맞는 가변적인 디드업리케이션 임계값을 적용하여 디스크 분할을 감소시킨다.
- 저지연 시간으로 쓰기 I/O 동안 중복을 제거하기 위해 우선순위 기반 메모리 내 지문 캐시를 활용한 인라인 디드업리케이션을 시행한다.
- 캐시되지 않은 나머지 중복 데이터를 공백 시간 동안 실행되는 후처리 단계로 이관하여 정확한 디드업리케이션을 달성한다.
- Valiant & Valiant의 영감을 받은 미사용 분포 추정 기법을 활용하여 미사용 중복 수를 추정함으로써 캐시 효율성을 향상시킨다.
실험 결과
연구 질문
- RQ1다중 테넌트 클라우드 워크로드에서 시간적 국소성을 효과적으로 추정하여 인라인 디드업리케이션 캐시 효율성을 향상시킬 수 있는가?
- RQ2시간적 및 공간적 국소성이 상이한 여러 데이터 스트림 간에 지문 캐시 할당을 최적화하기 위한 전략은 무엇인가?
- RQ3인라인 및 후처리 디드업리케이션을 융합한 하이브리드 접근 방식이 성능 저하를 최소화하면서 정확한 디드업리케이션을 달성할 수 있는가?
- RQ4공간적 국소성에 기반한 동적 임계값 설정이 디스크 분할을 줄이고 전체 디드업리케이션 효율성을 향상시키는가?
- RQ5동적 국소성 추정이 후처리 디드업리케이션의 부담과 피크 스토리지 용량 요구량을 어느 정도 감소시킬 수 있는가?
주요 결과
- HPDedup는 iDedup 대비 최대 39.70% 높은 인라인 캐시 효율성을 확보하여 쓰기 I/O 동안 더 많은 중복 데이터를 조기에 탐지한다.
- 하이브리드 설계 덕분에 최첨단 후처리 디드업리케이션 메커니즘 대비 피크 스토리지 용량 요구량을 최대 45.08% 감소시켰다.
- 고국소성 스트림을 우선순위로 삼음으로써 캐시 오염을 줄이고, 특히 간섭이 발생하는 다중 테넌트 환경에서 캐시 히트 비율을 향상시켰다.
- 각 스트림에 맞는 가변 임계값을 적용함으로써 고정 임계값 방식 대비 디스크 분할을 줄이고 I/O 성능을 향상시켰다.
- I/O 지연 시간을 희생시키지 않고도 프라이머리 스토리지에서 정확한 디드업리케이션을 달성하여 순수한 인라인 및 후처리 기법을 모두 능가했다.
- 동적 국소성 추정 모델은 중복 빈도를 정확히 예측할 수 있어 효율적인 캐시 할당을 가능하게 하고 후처리에 대한 의존도를 감소시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.