Skip to main content
QUICK REVIEW

[論文レビュー] Canvas: Isolated and Adaptive Swapping for Multi-Applications on Remote Memory

Chenxi Wang, Yifan Qiao|arXiv (Cornell University)|Mar 17, 2022
Cloud Computing and Resource Management被引用数 6
ひとこと要約

本稿では、複数のリモートメモリアプリケーション間でスワップリソース(スワップパーティション、キャッシュ、RDMA帯域幅など)を隔離することで、パフォーマンス干渉を解消する新規スワップシステム\toolを提案する。アプリケーション固有の最適化技術(適応的エントリ割り当て、意味論に配慮したプリフェッチ、2次元RDMAスケジューリング)を可能にすることで、パフォーマンス変動を低減し、共有スワップシステムと比較して、共同実行ワークロードで最大6倍の高速化を達成する。

ABSTRACT

Remote memory techniques for datacenter applications have recently gained a great deal of popularity. Existing remote memory techniques focus on the efficiency of a single application setting only. However, when multiple applications co-run on a remote-memory system, significant interference could occur, resulting in unexpected slowdowns even if the same amounts of physical resources are granted to each application. This slowdown stems from massive sharing in applications' swap data paths. Canvas is a redesigned swap system that fully isolates swap paths for remote-memory applications. Canvas allows each application to possess its dedicated swap partition, swap cache, prefetcher, and RDMA bandwidth. Swap isolation lays a foundation for adaptive optimization techniques based on each application's own access patterns and needs. We develop three such techniques: (1) adaptive swap entry allocation, (2) semantics-aware prefetching, and (3) two-dimensional RDMA scheduling. A thorough evaluation with a set of widely-deployed applications demonstrates that Canvas minimizes performance variation and dramatically reduces performance degradation.

研究の動機と目的

  • 複数アプリケーションのリモートメモリシステムにおいて、共有スワップリソースが原因となる深刻なパフォーマンス干渉を解消すること。
  • 既存のスワップシステムが、アプリケーション間干渉の影響により、ロック競合、制御不能なRDMA使用、効果の薄いプリフェッチに苦しんでいることを特定すること。
  • スワップキャッシュ、スワップパーティション、RDMA帯域幅の包括的隔離メカニズムを設計し、アプリケーション固有の最適化を可能にすること。
  • アプリケーションのアクセスパターンとリソース要件に特化した適応的最適化技術を開発すること。
  • 隔離と適応的スワッピングが、リモートメモリシステムにおける共同実行ワークロードのパフォーマンス劣化を顕著に低減することを実証すること。

提案手法

  • アプリケーションごとに専用のスワップパーティション、スワップキャッシュ、RDMA帯域幅を割り当てるために、カーネルスワップサブシステムを再設計する。
  • アプリケーションレベルのスワップエントリ割り当てとアプリケーションごとの会計処理を実装し、ロック競合を低減する。
  • 低レベルのアクセスパターン検出と意味論的分析を組み合わせた2段階プリフェッチャーを導入し、プリフェッチの正確性を向上させる。
  • 要求のタイミング感受性に基づいて、ディーマンドとプリフェッチ要求を分離・優先順位付けする2次元RDMAスケジューラを設計する。
  • 非同期プリフェッチ要求の遅延を低減するため、タイムリーさをフェアネスよりも優先する水平スケジューリングを統合する。
  • cgroupに基づくリソース会計を活用し、隔離を強制するとともに、アプリケーションに配慮した最適化意思決定を可能にする。

実験結果

リサーチクエスチョン

  • RQ1共有スワップリソースの使用が、複数アプリケーションのリモートメモリシステムでどのようにパフォーマンス干渉を引き起こすか?
  • RQ2共有スワップエントリ割り当てにおけるロック競合が、システムスループットとRDMA利用効率をどの程度悪化させるか?
  • RQ3アプリケーション固有のプリフェッチ戦略は、高スループットのリモートメモリ環境で効果的か?
  • RQ4RDMAスケジューリングが、共同実行ワークロードにおけるプリフェッチの遅延と成功確率に与える影響は?
  • RQ5スワップリソースの隔離と適応的最適化を適用した場合、多様なワークロードにおけるパフォーマンスにどのような影響を与えるか?

主な発見

  • 同じCPUおよびローカルメモリリソースを共有する場合、共有スワップシステム上で共同実行されるアプリケーションは、リソース競合のため最大6倍の遅延を経験する。
  • スワップエントリ割り当ての処理が、高アクセス窓では最大70%の時間を占めることが判明し、共有システムにおける深刻なロック競合を示している。
  • \\toolの2段階プリフェッチャーは、GraphX-CCにおいてプリフェッチ寄与度を10.7%、正確性を5.5%向上させ、遅延低減に寄与した。
  • 水平スケジューリングにより、90百分位のプリフェッチ遅延が約5%低減され、2段階プリフェッチャーと組み合わせて全体のパフォーマンスが7〜12%向上した。
  • 隔離と適応的最適化の組み合わせにより、パフォーマンス変動が低減され、多様なワークロードにおいて高いRDMA利用効率を維持した。
  • Leapプリフェッチャーでさえ、水平スケジューリングにより最大9倍の遅延低減を達成した。これは、遅延感受性の高いシナリオにおいて、その有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。