Skip to main content
QUICK REVIEW

[論文レビュー] TritanDB: Time-series Rapid Internet of Things Analytics

Eugene Siow, Thanassis Tiropanis|arXiv (Cornell University)|Jan 24, 2018
Time Series Analysis and Forecasting参考文献 24被引用数 6
ひとこと要約

TritanDB は、IoT ワークロードに最適化された新しい時系列データベースであり、効率的な圧縮およびストレージ構造と、軽量なクエリ翻訳レイヤーを組み合わせることで、リソース制限のあるデバイスおよびクラウドシステムの両方で高性能な分析を実現する。TritanDB は、IoT シナリオにおいて、最先端のデータベースと比較して最大で1桁の性能向上を達成するとともに、最小限のランタイムオーバーヘッドで RDF ベースのデータ統合をサポートする。

ABSTRACT

The efficient management of data is an important prerequisite for realising the potential of the Internet of Things (IoT). Two issues given the large volume of structured time-series IoT data are, addressing the difficulties of data integration between heterogeneous Things and improving ingestion and query performance across databases on both resource-constrained Things and in the cloud. In this paper, we examine the structure of public IoT data and discover that the majority exhibit unique flat, wide and numerical characteristics with a mix of evenly and unevenly-spaced time-series. We investigate the advances in time-series databases for telemetry data and combine these findings with microbenchmarks to determine the best compression techniques and storage data structures to inform the design of a novel solution optimised for IoT data. A query translation method with low overhead even on resource-constrained Things allows us to utilise rich data models like the Resource Description Framework (RDF) for interoperability and data integration on top of the optimised storage. Our solution, TritanDB, shows an order of magnitude performance improvement across both Things and cloud hardware on many state-of-the-art databases within IoT scenarios. Finally, we describe how TritanDB supports various analyses of IoT time-series data like forecasting.

研究の動機と目的

  • エッジデバイスおよびクラウドプラットフォームの両方における IoT 時系列データ管理におけるパフォーマンスボトルネックを解決すること。
  • 相互運用性のための RDF データモデルの効率的利用を可能にすることで、異種 IoT デバイス間のデータ統合を改善すること。
  • IoT 時系列データの独自の特性に適合した最適な圧縮技術およびストレージ構造を同定すること。
  • 最適化された時系列ストレージ上で SPARQL クエリを実行する際のランタイムオーバーヘッドを最小限に抑えるクエリ翻訳レイヤーを設計すること。
  • 時系列データに対して予測や集計などの高度な分析操作を高い効率で実行できること。

提案手法

  • 公開済みの IoT データセットを分析し、共通の特徴(平坦で広がり、数値的で、間隔が不規則な時系列)を同定する。
  • 性能に焦点を当てた最先端の時系列データベース技術を評価し、圧縮およびインデキシングの観点から性能を検証する。
  • I/O を削減し、クエリスループットを向上させるために、最適化されたデータ構造と圧縮を用いたカスタムストレージエンジンを設計する。
  • SPARQL アルジュブラを効率的な時系列操作にマッピングする、軽量な SPARQL から TritanDB 操作への翻訳レイヤーを実装する。
  • パフォーマンスへの影響を最小限に抑えるために、選択的クエリ処理を用いて、RDF ベースのデータモデリングを効率的にサポートする。
  • マップ・マッチ・オペレートパイプラインを採用し、'オペレート'段階で SPARQL アルジュブラ演算子を、時系列データに対するネイティブな TritanDB 操作(結合、フィルタ、集計、ソートなど)にマッピングする。

実験結果

リサーチクエスチョン

  • RQ1実世界の IoT 時系列データの支配的構造的特徴は何か? そして、それらはどのように効率的なストレージおよびクエリ処理に活用できるか?
  • RQ2制限付き環境およびクラウド環境の両方で、時系列データのパフォーマンスを最大化するのに最適な圧縮技術およびデータ構造は何か?
  • RQ3パフォーマンスを犠牲にすることなく、高性能な時系列データベースで RDF ベースのデータモデリングを効率的にサポートできるか?
  • RQ4リソース制限のあるデバイス上で、ランタイムオーバーヘッドを最小限に抑えて、SPARQL クエリを効率的な時系列データ操作に翻訳する方法は何か?
  • RQ5統合されたデータベースシステムは、エッジデバイスおよびクラウドデプロイメントの両方で、IoT 分析に対して高いパフォーマンスを達成できるか、その程度はどの程度か?

主な発見

  • TritanDB は、エッジおよびクラウドの両ハードウェアにおいて、IoT ワークロードで最先端のデータベースと比較して最大で1桁の性能向上を達成する。
  • 最適化されたストレージ構造および圧縮技術の使用により、I/O が顕著に削減され、特に時系列範囲および集計クエリにおいてクエリスループットが向上する。
  • SPARQL クエリ翻訳レイヤーは、ランタイムオーバーヘッドが無視できるほど小さく、リソース制限のあるデバイスでも複雑なクエリの効率的実行を可能にする。
  • パフォーマンスへの影響を最小限に抑えながら、RDF を通じた包括的なデータモデリングをサポートし、異種 IoT システム間の相互運用性を実現する。
  • TritanDB は、効率的な時系列対応演算子を用いて、予測、グループ化、集計などの高度な分析操作をネイティブにサポートする。
  • ベンチマーク結果では、TritanDB が MongoDB、Cassandra、OpenTSDB、Elasticsearch などのシステムを、複数のクエリタイプおよびデータ量において上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。