Skip to main content
QUICK REVIEW

[論文レビュー] COLE: A Column-based Learned Storage for Blockchain Systems

Ce Zhang, Cheng Xu|arXiv (Cornell University)|Jun 19, 2023
Advanced Data Storage Technologies被引用数 4
ひとこと要約

COLEは、各ステートの履歴値を連続して格納し、ディスク最適化された学習モデルでインデックスを構築することで、ブロックチェーンシステムにおけるストレージオーバーヘッドを低減するカラムベースの学習済みストレージシステムを提案する。Merkle Patricia Trieと比較して最大94%のストレージサイズ削減と1.4×–5.4×の高いスループットを達成し、Merkleファイルストリーミングおよび非同期マージ戦略により、プロヴァンスリクエストとデータ整合性をサポートする。

ABSTRACT

Blockchain systems suffer from high storage costs as every node needs to store and maintain the entire blockchain data. After investigating Ethereum's storage, we find that the storage cost mostly comes from the index, i.e., Merkle Patricia Trie (MPT). To support provenance queries, MPT persists the index nodes during the data update, which adds too much storage overhead. To reduce the storage size, an initial idea is to leverage the emerging learned index technique, which has been shown to have a smaller index size and more efficient query performance. However, directly applying it to the blockchain storage results in even higher overhead owing to the requirement of persisting index nodes and the learned index's large node size. To tackle this, we propose COLE, a novel column-based learned storage for blockchain systems. We follow the column-based database design to contiguously store each state's historical values, which are indexed by learned models to facilitate efficient data retrieval and provenance queries. We develop a series of write-optimized strategies to realize COLE in disk environments. Extensive experiments are conducted to validate the performance of the proposed COLE system. Compared with MPT, COLE reduces the storage size by up to 94% while improving the system throughput by $1.4 imes$-$5.4 imes$.

研究の動機と目的

  • 実際の取引コンテンツがデータの2.8%に過ぎないにもかかわらず、インデックス(例:Merkle Patricia Trie)がストレージオーバーヘッドの大部分を占めるブロックチェーンシステムにおける高いストレージコストに対処すること。
  • 従来の学習インデックスが、大きなノードサイズと恒久的ノード要件のため、データ整合性、プロヴァンスリクエスト、効率的なディスクベースの書き込みを満たせないという限界を克服すること。
  • 効率的なプロヴァンスリクエスト、データ整合性、およびディスク環境下での高い書き込みスループットをサポートする、ブロックチェーンに適した学習インデックスを設計すること。
  • ストレージフットプリントを増加させることなく、チェックポイントベースの非同期マージ戦略により、ブロックチェーンストレージにおけるロングテール書き込み遅延を低減すること。
  • 最新ブロックの学習インデックスに依存することで、古くなったブロックインデックスの走査を回避し、履歴データの効率的取得を可能にすること。

提案手法

  • 各ブロックチェーンステートの履歴値を連続して格納するカラムベースのデータベース設計を採用し、効率的な圧縮とアクセスパターンを実現すること。
  • LSMツリーの各ラン内に、従来のB+-ツリー構造を置き換えるディスク最適化された学習インデックスを実装し、最小限のストレージコストでデータ位置を回帰モデルで予測すること。
  • バージョン間のデータ整合性を維持するためのストリーミングアルゴリズムを導入し、Merkleファイルを構築することで、履歴ステートの暗号的検証を可能にすること。
  • 書き込み処理とコンパクションを分離するチェックポイントベースの非同期マージ戦略を設計し、長期間にわたる書き込み遅延を1〜2桁低減すること。
  • バージョン付きブロック高さを追加専用識別子として使用し、最新ブロックの学習インデックスを介して効率的なステート更新とプロヴァンスリクエストを実現すること。
  • カラムレイアウトを活用して、隣接するステートバージョン間の類似性を活用するデータ圧縮技術の将来的な統合を可能にすること。

実験結果

リサーチクエスチョン

  • RQ1学習インデックスがブロックチェーンストレージに効果的に適応可能であるか。特に、インデックスサイズの削減とデータ整合性、プロヴァンスリクエストのサポートを維持できるか。
  • RQ2頻繁な書き込み操作と高い耐久性要件を満たすディスクベースのストレージシステムにおいて、学習インデックスをどのように最適化できるか。
  • RQ3学習インデックスが通常大きなノードサイズを持つため、ブロックチェーンシステムにおける恒久的インデックスノードのストレージオーバーヘッドを最小限に抑えるための設計パターンは何か。
  • RQ4学習インデックスを備えたカラムストレージモデルが、ブロックチェーンワークロードにおけるロングテール書き込み遅延をどの程度低減できるか。
  • RQ5Merkleファイルストリーミングと学習インデックスの統合により、陳腐化したインデックスツリーを走査することなく、効率的かつ暗号的に検証可能なプロヴァンスリクエストを実現できるか。

主な発見

  • COLEは、Merkle Patricia Trieと比較して、ブロックチェーンのストレージサイズを最大94%削減し、その大部分の削減は、冗長なインデックスノードの恒久的保存の削除に起因する。
  • 学習インデックスによる高速なクエリパフォーマンスと最適化された書き込みパターンのおかげで、MPTと比較してシステムスループットが1.4×から5.4×向上する。
  • チェックポイントベースの非同期マージ戦略により、ストレージフットプリントをベースラインと同等に保ちながら、ロングテール書き込み遅延を1〜2桁低減する。
  • カラムレイアウトにより、最新ブロックの学習インデックスのみを用いてプロヴァンスリクエストを解決できるため、陳腐化したインデックスツリーの走査を回避し、履歴データの効率的取得が可能になる。
  • ストリーミングMerkleファイル構築アルゴリズムにより、最小限のランタイムコストで任意の履歴ステートのデータ整合性を保証し、暗号的検証を可能にする。
  • SmallBankワークロードにおける評価では、基礎となるデータが総ストレージの2.8%にしか寄与しないため、インデックスの肥大化が主なストレージボトルネックであることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。