Skip to main content
QUICK REVIEW

[論文レビュー] Hydra -- A Federated Data Repository over NDN

Justin Presley, Xi Wang|arXiv (Cornell University)|Nov 2, 2022
Caching and Content Delivery被引用数 4
ひとこと要約

Hydra は、名前ベースデータネットワーキング(NDN)上で構築された分散型でフェデレーテッドなデータレポジトリであり、分散型コミュニティ間での安全でスケーラブルかつレジリエントな科学的データ共有を可能にする。NDN のデータ中心のセキュリティ、インフラストラクチャ内キャッシュ、およびステートベクタ同期(SVS)プロトコルを活用することで、Hydra はレプリケーションと障害回復を自動化し、ファイル挿入(100 MB ファイルで最大 135.65 Mbps)および高速キャッシュベースの取得(最大 185.82 Mbps)において高いパフォーマンスを達成した。

ABSTRACT

Today's big data science communities manage their data publication and replication at the application layer. These communities utilize myriad mechanisms to publish, discover, and retrieve datasets - the result is an ecosystem of either centralized, or otherwise a collection of ad-hoc data repositories. Publishing datasets to centralized repositories can be process-intensive, and those repositories do not accept all datasets. The ad-hoc repositories are difficult to find and utilize due to differences in data names, metadata standards, and access methods. To address the problem of scientific data publication and storage, we have designed Hydra, a secure, distributed, and decentralized data repository made of a loose federation of storage servers (nodes) provided by user communities. Hydra runs over Named Data Networking (NDN) and utilizes the State Vector Sync (SVS) protocol that lets individual nodes maintain a "global view" of the system. Hydra provides a scalable and resilient data retrieval service, with data distribution scalability achieved via NDN's built-in data anycast and in-network caching and resiliency against individual server failures through automated failure detection and maintaining a specific degree of replication. Hydra utilizes "Favor", a locally calculated numerical value to decide which nodes will replicate a file. Finally, Hydra utilizes data-centric security for data publication and node authentication. Hydra uses a Network Operation Center (NOC) to bootstrap trust in Hydra nodes and data publishers. The NOC distributes user and node certificates and performs the proof-of-possession challenges. This technical report serves as the reference for Hydra. It outlines the design decisions, the rationale behind them, the functional modules, and the protocol specifications.

研究の動機と目的

  • 科学的コミュニティが使用する中央集権的または一時的なデータレポジトリに起因する非効率さとボトルネックを解消すること。
  • 分散型でコミュニティ主導のデータ共有を可能にすることで、データ公開および管理の負担を軽減すること。
  • データ中心のネーミングとインフラストラクチャ内キャッシュを通じて、データの検索可能性、再利用可能性、パフォーマンスを向上させること。
  • データ中心のセキュリティ、暗号署名、および証明書管理のためのネットワーク運用センター(NOC)を活用して、強固なセキュリティと信頼性を確保すること。
  • SVS プロトコルを用いた自動化されたレプリケーションと障害検出により、システムのレジリエンスとスケーラビリティを実現すること。

提案手法

  • 科学的コミュニティが管理するストレージノードのフェデレーテッドネットワークを展開し、各コミュニティが Hydra フェデレーションにリソースを寄与する。
  • コンテンツベースのアドレッシング、インフラストラクチャ内キャッシュ、データ中心のセキュリティを可能にするために、名前ベースデータネットワーキング(NDN)を基盤のトランスポートレイヤーとして使用する。
  • すべてのノード間でシステム状態の一貫性のあるグローバルビューを維持するために、ステートベクタ同期(SVS)プロトコルを実装する。
  • ノード属性に基づいて局所的に計算される値である「Favor」メトリックを適用し、知能的で自動化されたレプリケーション意思決定を支援する。
  • 証明書所有の証明チャレンジを用いて、ノードおよびユーザーの証明書を発行・検証するネットワーク運用センター(NOC)を活用して、システムを保護する。
  • データをチャンクに分割し、複数のノードに分散して格納することで、NDNベースのコマンドを用いてデータ操作(クエリ、挿入、取得、削除)を実行する。

実験結果

リサーチクエスチョン

  • RQ1どのようにして、科学的コミュニティにおける中央集権的または一時的なデータ管理システムへの依存を低減する分散型でフェデレーテッドなデータレポジトリを構築できるか?
  • RQ2NDN のインフラストラクチャ内キャッシュおよびデータアナスカットが、データ取得のパフォーマンスとスケーラビリティをどの程度向上できるか?
  • RQ3「Favor」メトリックは、分散ノード間で効率的でレジリエントかつ自動化されたデータレプリケーションを指導するためにどの程度効果的か?
  • RQ4動的な分散環境において、SVS プロトコルは低遅延かつ高可用性を維持しながら、一貫性のあるグローバルシステム状態を保つことができるか?
  • RQ5実際のテストベッド環境下で、Hydra の安全で自動化されたデータ公開およびレプリケーションパイプラインのパフォーマンスオーバーヘッドと信頼性はどの程度か?

主な発見

  • 100 MB ファイルの平均ファイル挿入速度は、プライマリレプリカ(rep1)で 135.65 Mbps、セカンドリレプリカ(rep2)で 61.72 Mbps を記録し、強力な書き込みスケーラビリティを示した。
  • キャッシュを活用することで、ファイル取得パフォーマンスが著しく向上した:キャッシュから取得した場合、100 MB ファイルで最大 185.82 Mbps に達したのに対し、キャッシュなしでは 13.85 Mbps にとどまった。
  • 大容量ファイル(1 GB)では、キャッシュサイズが限られている(500 MB)ため、キャッシュの恩恵が限定的であり、キャッシュなし(13.37 Mbps)とキャッシュあり(13.51 Mbps)の速度はほぼ同等であった。
  • SVS プロトコルを用いることで、ノード間で一貫性のある状態を維持でき、信頼性の高い障害検出と自動レプリケーションが可能になった。
  • 複数のテストベッドトポロジーおよびデータサイズで、Hydra クライアントコマンド(クエリ、挿入、取得、削除)が検証され、機能的正しさと耐障害性が確認された。
  • FABRIC テストベッドへの展開により、Hydra が生産環境向けに実用的で、安全かつスケーラブルな科学的ワークロードのデータ共有プラットフォームとしての実現可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。