[論文レビュー] OSMOSIS: Enabling Multi-Tenancy in Datacenter SmartNICs
OSMOSIS は、データセンタでのフェアで作業を最適化するマルチテナントを実現するため、スマートNICに共同設計された軽量でハードウェア支援のリソースマネージャーである。SR-IOV仮想化と新規スケジューリングポリシーを用いて、コンピューティング、DMA、エグレス帯域幅のパフォーマンス隔離とQoSを実現し、フロー完了時間の最大63%の高速化と、従来のスケジューラーよりも83%高いフェアネスを達成した。
Multi-tenancy is essential for unleashing SmartNIC's potential in datacenters. Our systematic analysis in this work shows that existing on-path SmartNICs have resource multiplexing limitations. For example, existing solutions lack multi-tenancy capabilities such as performance isolation and QoS provisioning for compute and IO resources. Compared to standard NIC data paths with a well-defined set of offloaded functions, unpredictable execution times of SmartNIC kernels make conventional approaches for multi-tenancy and QoS insufficient. We fill this gap with OSMOSIS, a SmartNICs resource manager co-design. OSMOSIS extends existing OS mechanisms to enable dynamic hardware resource multiplexing of the on-path packet processing data plane. We integrate OSMOSIS within an open-source RISC-V-based 400Gbit/s SmartNIC. Our performance results demonstrate that OSMOSIS fully supports multi-tenancy and enables broader adoption of SmartNICs in datacenters with low overhead.
研究の動機と目的
- マルチテナントデータセンタワークロードにおける、現在のオンパススマートNICに見られるパフォーマンス隔離とQoSの欠如に対処すること。
- 従来のマルチテナントメカニズムが効果的に機能しない原因となる、スマートNICにおける予測不能なカーネル実行時間の課題を克服すること。
- コンピューティング、DMA帯域幅、エグレス帯域幅という3つの重要なリソースを、同時に実行される異種ワークロード間でフェアに多重化できるシステムを設計すること。
- 最小限のハードウェアオーバーヘッドで効率的かつ作業を最適化するリソース割り当てを実現し、表現力豊かなSLOセマンティクスをサポートすること。
- 提案されたシステムが、低遅延で予測可能なパフォーマンス隔離を提供することで、生産環境のデータセンタでのスマートNICの広範な採用を可能にすること。
提案手法
- パフォーマンスが重要なタスクのためのハードウェアスケジューリングを統合し、非重要管理を柔軟なソフトウェアランタイムにオフロードする、軽量な管理レイヤー OSMOSIS を共同設計する。
- 単一ルートI/O仮想化(SR-IOV)仮想機能(VF)を通じて各テナントにスマートNICを公開し、ハードウェアリソースへの直接的かつ隔離されたアクセスを可能にする。
- テナントのSLOに基づいて動的にコンピューティングおよびI/Oリソースを割り当てる、作業を最適化し、優先順位を考慮したスケジューリングポリシーである「重み付き負荷分散仮想時間(WLBVT)」を実装する。
- ハードウェアベースのスケジューリングにより、パケット処理の実行時間を上限付きで予測可能にし、予測不能なカーネルワークロードの影響を軽減する。
- 実際のデータセンタワークロード下でのリソース多重化の評価を可能にするために、オープンソースのRISC-Vベース400Gbit/sスマートNICと統合する。
- ハイブリッドアプローチを活用:時間的に重要なスケジューリング意思決定にはハードウェア、設定およびポリシー強制にはソフトウェアを用い、ハードウェアフットプリントを最小限に抑える。

実験結果
リサーチクエスチョン
- RQ1処理要件が予測不能で状態依存的かつ多様なワークロードが存在する場合、スマートNICでパフォーマンス隔離とQoSをどのように達成できるか?
- RQ2複数のテナントが異なるSLOを持つ場合に、コンピューティング、DMA、エグレス帯域幅をフェアかつ作業を最適化する形で割り当てるためのスケジューリングメカニズムは何か?
- RQ3ハードウェアとソフトウェアが共同設計されたリソースマネージャーは、コンピューティングおよびI/Oバウンドアプリケーションが混在するワークロードにおいて、フロー完了時間を短縮しつつフェアネスを維持できるか?
- RQ4従来のラウンドロビンやその他のベースラインスケジューラーと比較して、提案されたシステムはフェアネスおよびパフォーマンス隔離の観点でどの程度優れているか?
- RQ5本ソリューションのオーバーヘッドとスケーラビリティは、実際の高速(400Gbps)データセンタ環境においてどの程度か?
主な発見
- OSMOSIS は、I/OバウンドワークロードにおけるJainのフェアネス指数を用いた測定で、従来のラウンドロビンスケジューリングと比較して最大83%のフェアネス向上を達成した。
- I/Oバウンドワークロードでは、OSMOSIS がフローフルーケーション時間を最大63%短縮し、ヘッド・オブ・ラインブロッキングの解消と効率的でフェアなリソース割り当てを可能にした。
- コンピューティングバウンドの状況では、OSMOSIS は標準のラウンドロビンと比較して47%高いフェアネスを達成し、フローフルーケーション時間が39-7%速くなった。
- マルチテナント下でも、OSMOSIS はI/Oライトワークロードで332Mppsの高いスループットを維持した。カーネル完了時間のばらつきによるPsPINベースライン比で僅か3%のスループット上昇にとどまった。
- OSMOSIS は、一部のテナントが優先順位のため、中央値のカーネル完了時間が最大8倍に延長されても、全体のシステムパフォーマンスを犠牲にすることなく、フェアで効率的なリソース共有を実現した。
- 本ソリューションは低オーバーヘッドであり、実際の400Gbit/s RISC-VベーススマートNICでも動作可能であり、生産環境データセンタへの導入可能性を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。