[論文レビュー] HPDedup: A Hybrid Prioritized Data Deduplication Mechanism for Primary Storage in the Cloud
HPDedup は、クラウドプライマリーストレージ向けに、インラインフィンガープrintキャッシュとポストプロセッシングデデュプリケーションを組み合わせたハイブリッドで優先順位付きのデデュプリケーションメカニズムを提案する。これにより、低 I/O ラテンシを維持したまま正確なデデュプリケーションを実現する。マルチテナント VM 間での時間的局所性を動的に推定し、予測された重複頻度に基づいてキャッシュを割り当てることで、HPDedup はインラインキャッシュ効率を最大 39.70% 向上させ、最新の手法と比較してピークストレージ使用量を最大 45.08% 減少させる。
Eliminating duplicate data in primary storage of clouds increases the cost-efficiency of cloud service providers as well as reduces the cost of users for using cloud services. Existing primary deduplication techniques either use inline caching to exploit locality in primary workloads or use post-processing deduplication running in system idle time to avoid the negative impact on I/O performance. However, neither of them works well in the cloud servers running multiple services or applications for the following two reasons: Firstly, the temporal locality of duplicate data writes may not exist in some primary storage workloads thus inline caching often fails to achieve good deduplication ratio. Secondly, the post-processing deduplication allows duplicate data to be written into disks, therefore does not provide the benefit of I/O deduplication and requires high peak storage capacity. This paper presents HPDedup, a Hybrid Prioritized data Deduplication mechanism to deal with the storage system shared by applications running in co-located virtual machines or containers by fusing an inline and a post-processing process for exact deduplication. In the inline deduplication phase, HPDedup gives a fingerprint caching mechanism that estimates the temporal locality of duplicates in data streams from different VMs or applications and prioritizes the cache allocation for these streams based on the estimation. HPDedup also allows different deduplication threshold for streams based on their spatial locality to reduce the disk fragmentation. The post-processing phase removes duplicates whose fingerprints are not able to be cached due to the weak temporal locality from disks. Our experimental results show that HPDedup clearly outperforms the state-of-the-art primary storage deduplication techniques in terms of inline cache efficiency and primary deduplication efficiency.
研究の動機と目的
- 共用された VM やコンテナを有するマルチテナントワークロードにおける弱い時間的局所性のため、クラウドプライマリーストレージにおけるデデュプリケーション効率の低さという課題に対処すること。
- 純粋なインラインキャッシュ(低局所性ストリームで無駄なキャッシュ領域を消費)および純粋なポストプロセッシングデデュプリケーション(高いピークストレージ使用量と I/O オーバーヘッド)の限界を克服すること。
- 異なるアプリケーションからのデータストリームの時間的局所性を推定し、それに基づいてキャッシュ割り当てを優先順位付けすることで、インラインデデュプリケーションのキャッシュ利用効率を向上させること。
- 空間的局所性に基づくアプリケーション固有のデデュプリケーション閾値を適用することで、ディスク断片化を低減し、デデュプリケーション効率を向上させること。
- インライン処理とポストプロセッシングフェーズを効果的に統合することで、最小限のパフォーマンス影響でプライマリーストレージで正確なデデュプリケーションを達成すること。
提案手法
- 異なる VM やアプリケーションからのデータストリームにおける重複頻度を予測するための動的時間的局所性推定アルゴリズムを導入する。
- 推定された局所性をもとに、予測された重複頻度がより高いストリームを優先してフィンガープリントキャッシュを割り当てる。
- 空間的局所性に基づいて各ストリームごとに可変のデデュプリケーション閾値を適用し、ディスク断片化を低減する。
- 低ラテンシで書き込み I/O 時に重複を削除する、優先順位付きメモリ内フィンガープリントキャッシュを用いたインラインデデュプリケーションを実装する。
- キャッシュにのらずに残った重複を、空き時間に実行されるポストプロセッシングフェーズにオフロードし、正確なデデュプリケーションを達成する。
- ヴァリヤントとヴァリヤントにインspiredされた未観測分布推定技術を活用し、未確認の重複数を推定することで、キャッシュ効率を向上させる。
実験結果
リサーチクエスチョン
- RQ1マルチテナントクラウドワークロードにおける時間的局所性を、インラインデデュプリケーションキャッシュ効率を向上させるために効果的に推定するにはどうすればよいか?
- RQ2時間的および空間的局所性が異なる複数のデータストリーム間で、フィンガープリントキャッシュの割り当てを最適化する戦略は何か?
- RQ3インライン処理とポストプロセッシングを組み合わせたハイブリッドアプローチは、パフォーマンス劣化を最小限に抑えつつ正確なデデュプリケーションを達成できるか?
- RQ4空間的局所性に基づく動的閾値設定は、ディスク断片化をどのように低減させ、全体のデデュプリケーション効率を向上させるか?
- RQ5動的局所性推定は、ポストプロセッシングデデュプリケーションの負荷とピークストレージ容量要件をどの程度軽減できるか?
主な発見
- HPDedup は、iDedup と比較してインラインキャッシュ効率を最大 39.70% 向上させ、書き込み I/O 時に捕捉される重複数を顕著に増加させた。
- ハイブリッド設計により、最新のポストプロセッシングデデュプリケーション手法と比較して、ピークストレージ容量要件を最大 45.08% 減少させた。
- 高局所性ストリームを優先することで、キャッシュ汚染を低減し、特に干渉するワークロードを有するマルチテナント環境においてキャッシュヒットレートを向上させた。
- ストリームごとの可変デデュプリケーション閾値の適用により、固定閾値アプローチと比較してディスク断片化が低減し、I/O パフォーマンスが向上した。
- HPDedup は、I/O ラテンシに影響を与えることなく、プライマリーストレージで正確なデデュプリケーションを達成し、純粋なインラインおよびポストプロセッシング手法を上回る性能を発揮した。
- 動的局所性推定モデルにより、重複頻度の正確な予測が可能となり、効率的なキャッシュ割り当てが実現し、ポストプロセッシングへの依存度が低下した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。