Skip to main content
QUICK REVIEW

[논문 리뷰] COLE: A Column-based Learned Storage for Blockchain Systems

Ce Zhang, Cheng Xu|arXiv (Cornell University)|2023. 06. 19.
Advanced Data Storage Technologies인용 수 4
한 줄 요약

COLE는 블록체인 시스템을 위한 열기반 학습 저장소 시스템을 제안하며, 각 상태의 역사적 값을 연속적으로 저장하고 디스크 최적화된 학습 모델로 인덱싱하여 저장소 오버헤드를 줄입니다. Merkle Patricia Trie에 비해 최대 94% 더 작은 저장소 크기와 1.4×–5.4× 높은 처리량을 달성하면서도, Merkle 파일 스트리밍과 비동기 병합 전략을 통해 기록 추적 쿼리와 데이터 무결성 검증을 지원합니다.

ABSTRACT

Blockchain systems suffer from high storage costs as every node needs to store and maintain the entire blockchain data. After investigating Ethereum's storage, we find that the storage cost mostly comes from the index, i.e., Merkle Patricia Trie (MPT). To support provenance queries, MPT persists the index nodes during the data update, which adds too much storage overhead. To reduce the storage size, an initial idea is to leverage the emerging learned index technique, which has been shown to have a smaller index size and more efficient query performance. However, directly applying it to the blockchain storage results in even higher overhead owing to the requirement of persisting index nodes and the learned index's large node size. To tackle this, we propose COLE, a novel column-based learned storage for blockchain systems. We follow the column-based database design to contiguously store each state's historical values, which are indexed by learned models to facilitate efficient data retrieval and provenance queries. We develop a series of write-optimized strategies to realize COLE in disk environments. Extensive experiments are conducted to validate the performance of the proposed COLE system. Compared with MPT, COLE reduces the storage size by up to 94% while improving the system throughput by $1.4 imes$-$5.4 imes$.

연구 동기 및 목표

  • 실제 거래 내용이 전체 데이터의 2.8%에 불과함에도 불구하고 색인(예: Merkle Patricia Trie)이 저장소 오버헤드의 주요 원인이 되는 블록체인 시스템의 높은 저장소 비용을 해결합니다.
  • 기존의 블록체인 시스템에서의 학습 인덱스는 큰 노드 크기와 지속적인 노드 요구로 인해 데이터 무결성, 기록 추적 쿼리, 효율적인 디스크 기반 쓰기 작동을 지원하지 못하는 한계를 지닙니다.
  • 디스크 환경에서 높은 쓰기 처리량, 데이터 무결성, 기록 추적 쿼리 지원을 동시에 달성할 수 있는 블록체인 친화적 학습 인덱스를 설계합니다.
  • 스냅샷 기반 비동기 병합 전략을 통해 블록체인 저장소의 장시간 쓰기 지연을 줄이며, 저장소 포트폴리오 크기를 증가시키지 않습니다.
  • 최신 블록의 학습 인덱스를 활용해 오래된 블록 색인을 순회하지 않고도 효율적인 역사적 데이터 검색을 가능하게 합니다.

제안 방법

  • 각 블록체인 상태의 역사적 값을 연속적으로 저장하기 위해 열기반 데이터베이스 설계를 채택하여 압축 및 액세스 패턴을 최적화합니다.
  • LSM-트리 런 내부에 디스크 최적화된 학습 인덱스를 구현하여 기존의 B+-트리 아키텍처를 대체하며, 최소한의 저장소 비용으로 데이터 위치를 예측하기 위해 회귀 모델을 사용합니다.
  • 버전 간 데이터의 무결성을 유지하기 위해 Merkle 파일을 스트리밍 방식으로 생성하는 알고리즘을 도입하여 역사적 상태의 암호학적 검증을 가능하게 합니다.
  • 스냅샷 기반 비동기 병합 전략을 설계하여 쓰기 작업과 병합을 분리함으로써 장시간 쓰기 지연을 1–2개 주기만큼 감소시킵니다.
  • 버전화된 블록 높이를 추가 전용 식별자로 사용하여 최신 블록의 학습 인덱스를 통해 효율적인 상태 업데이트와 기록 추적 쿼리를 지원합니다.
  • 열기반 레이아웃을 활용해 인접한 상태 버전 간 유사성을 활용하는 데이터 압축 기법의 향후 통합을 가능하게 합니다.

실험 결과

연구 질문

  • RQ1학습 인덱스가 블록체인 저장소에 효과적으로 적용되어 색인 크기를 줄이면서도 데이터 무결성과 기록 추적 쿼리 지원을 유지할 수 있는가?
  • RQ2학습 인덱스를 빈번한 쓰기 작업과 높은 내구성 요구 사항을 가진 디스크 기반 저장소 시스템에 최적화할 수 있는가?
  • RQ3학습 인덱스가 일반적으로 더 큰 노드 크기를 가지므로, 블록체인 시스템에서 지속적인 색인 노드의 저장소 오버헤드를 최소화할 수 있는 설계 패턴은 무엇인가?
  • RQ4학습 인덱싱을 적용한 열기반 저장소 모델이 블록체인 워크로드에서 장시간 쓰기 지연을 얼마나 줄일 수 있는가?
  • RQ5Merkle 파일 스트리밍과 학습 인덱싱의 통합이 오래된 색인 트리 순회 없이도 효율적이고 암호학적으로 검증 가능한 기록 추적 쿼리를 가능하게 할 수 있는가?

주요 결과

  • COLE는 Merkle Patricia Trie 대비 최대 94%까지 블록체인 저장소 크기를 감소시키며, 대부분의 절감 효과는 중복된 색인 노드 영속화를 제거함으로써 발생합니다.
  • 학습 인덱싱으로 인한 더 빠른 쿼리 성능과 최적화된 쓰기 패턴 덕분에 MPT 대비 처리량이 1.4×에서 5.4× 향상됩니다.
  • 스냅샷 기반 비동기 병합 전략은 저장소 포트폴리오 크기를 기준선과 유사하게 유지하면서도 장시간 쓰기 지연을 1–2개 주기만큼 감소시킵니다.
  • 열기반 설계 덕분에 기록 추적 쿼리가 오직 최신 블록의 학습 인덱스만을 사용하여도 해결 가능해져 오래된 색인 트리 순회를 제거할 수 있습니다.
  • 스트리밍 방식의 Merkle 파일 생성 알고리즘은 최소한의 런타임 비용으로도 모든 역사적 상태의 데이터 무결성과 암호학적 검증을 보장합니다.
  • SmallBank 워크로드에서의 평가 결과, 기반 데이터가 총 저장소의 2.8%에 불과함을 확인하여 색인 팽창이 주요 저장소 병목 현상임을 입증합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.