Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Time Series Databases with IoTDB-Benchmark for IoT Scenarios

Rui Liu, Jun Yuan|arXiv (Cornell University)|Jan 24, 2019
Time Series Analysis and Forecasting被引用 12
一句话总结

本文提出 IoTDB-Benchmark,一个用于评估物联网场景下时序数据库(TSDB)的标准化框架,支持多种数据分布、乱序与批量写入,以及系统资源监控。该框架评估了 InfluxDB、OpenTSDB、KairosDB 和 TimescaleDB,结果显示 InfluxDB 在查询性能方面表现领先,同时对系统资源使用情况也进行了测量,以实现全面分析。

ABSTRACT

With the wide application of time series databases (TSDBs) in big data fields like cluster monitoring and industrial IoT, there have been developed a number of TSDBs for time series data management. Different TSDBs have test reports comparing themselves with other databases to show their advantages, but the comparisons are typically based on their own tools without using a common well-recognized test framework. To the best of our knowledge, there is no mature TSDB benchmark either. With the goal of establishing a standard of evaluating TSDB systems, we present the IoTDB-Benchmark framework, specifically designed for TSDB and IoT application scenarios. We pay close attention to some special data ingestion scenarios and summarize 10 basic queries types. We use this benchmark to compare four TSDB systems: InfluxDB, OpenTSDB, KairosDB and TimescaleDB. Our benchmark framework/tool not only measures performance metrics but also takes system resource consumption into consideration.

研究动机与目标

  • 为解决物联网应用中时序数据库(TSDB)缺乏标准化、广泛认可的基准测试问题。
  • 设计一个支持真实、多样化工作负载的基准测试,包括乱序数据写入和非规则时序数据分布。
  • 将系统资源消耗(CPU、内存、磁盘)纳入性能评估,以实现系统整体分析。
  • 提供一个可重用、可配置的基准测试工具,用于记录测试配置、结果和系统指标,以确保可重现性和进一步分析。
  • 实现对多种 TSDB 在真实物联网工作负载下的公平、可重复且全面的性能比较。

提出的方法

  • 设计一个可配置数据分布的基准测试框架(例如,带高斯噪声的正弦波、方波、锯齿波),以反映真实世界时序数据的多样性。
  • 实现一个数据生成器,支持有序与乱序批量数据写入,以模拟工业物联网中的数据模式。
  • 定义10种基本查询类型,涵盖时间范围、聚合与下采样操作,以匹配物联网工作负载的相关性。
  • 扩展基准测试工具,以在测试执行期间收集并持久化系统资源指标(CPU、内存、磁盘),用于性能与效率分析。
  • 使用关系型数据库管理基准测试配置、测试结果和系统指标,以实现可追溯性与高级分析。
  • 将该框架应用于评估四种 TSDB——InfluxDB、OpenTSDB、KairosDB 和 TimescaleDB——在不同工作负载和数据分布下的表现。

实验结果

研究问题

  • RQ1在不同时间序列数据分布(如周期性、不规则或含噪声的信号)下,不同 TSDB 的性能表现如何?
  • RQ2在 TSDB 中,有序与乱序数据写入工作负载之间的性能差异是什么?
  • RQ3在相同工作负载和数据量下,不同 TSDB 的系统资源消耗(CPU、内存、磁盘)如何变化?
  • RQ4在工业物联网场景中,哪种 TSDB 在数据写入与查询工作负载中综合表现最佳?
  • RQ5统一的基准测试框架能否有效支持复杂、混合工作负载,并提供可重现、可分析的结果?

主要发现

  • InfluxDB 在大多数查询工作负载中优于 OpenTSDB、KairosDB 和 TimescaleDB,尤其在聚合与下采样操作中表现更优。
  • OpenTSDB 和 TimescaleDB 在多数查询场景中表现相近,但速度均落后于 InfluxDB。
  • KairosDB 在除时间范围查询外的大多数查询类型中表现较差,表明其查询执行引擎可能存在效率问题。
  • 系统资源监控显示,InfluxDB 在 100 万条时序数据测试中保持约 6% 的 CPU 使用率和较高的磁盘使用率,表明其运行稳定但资源消耗较高。
  • 基准测试工具成功捕获并持久化了测试配置、性能指标和系统资源数据,实现了可追溯且可分析的评估。
  • 该框架证明了使用关系型数据库管理基准元数据的可行性,显著提升了可重现性与长期分析能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。