Skip to main content
QUICK REVIEW

[论文解读] Query Log Compression for Workload Analytics

Ting Xie, Oliver Kennedy|arXiv (Cornell University)|Sep 2, 2018
Advanced Database Systems and Queries参考文献 37被引用 3
一句话总结

本文提出 LogR,一种基于模式编码与聚类的有损查询日志压缩方案,可高效总结数据库工作负载以支持分析。通过引入作为保真度计算高效代理的重构误差(Reproduction Error),LogR 在保持更高精度的同时,比现有最先进方法实现更快的工作负载总结,且支持机器与人工对压缩日志的可解释性分析。

ABSTRACT

Analyzing database access logs is a key part of performance tuning, intrusion detection, benchmark development, and many other database administration tasks. Unfortunately, it is common for production databases to deal with millions or even more queries each day, so these logs must be summarized before they can be used. Designing an appropriate summary encoding requires trading off between conciseness and information content. For example: simple workload sampling may miss rare, but high impact queries. In this paper, we present LogR, a lossy log compression scheme suitable use for many automated log analytics tools, as well as for human inspection. We formalize and analyze the space/fidelity trade-off in the context of a broader family of "pattern" and "pattern mixture" log encodings to which LogR belongs. We show through a series of experiments that LogR compressed encodings can be created efficiently, come with provable information-theoretic bounds on their accuracy, and outperform state-of-art log summarization strategies.

研究动机与目标

  • 为解决大规模数据库查询日志因数据量过大而难以直接处理的挑战。
  • 设计一种有损压缩方案,以保留工作负载的关键统计特性,特别是稀有但具有高影响的查询。
  • 开发一种计算高效的编码保真度度量方法,其与经典指标(如模糊度 Ambiguity 和偏差 Deviation)具有强相关性。
  • 通过基于聚类的模式混合编码,显著缩小最优日志摘要的搜索空间。
  • 在准确性和效率方面均超越现有最先进的日志摘要技术。

提出的方法

  • LogR 将查询表示为基于结构元素(如 SELECT、FROM 和 WHERE 子句)的位向量特征向量。
  • 它引入了一类模式编码方法,将频繁共现的结构元素(即模式)映射为其在日志中的频率。
  • 为应对在所有可能编码上进行优化的不可计算性,LogR 使用聚类将日志划分为若干组,从而支持模式混合编码。
  • 它提出一种简化方法,称为朴素混合编码,即对每个聚类独立使用其自身的模式编码进行压缩。
  • 它引入了重构误差作为实际且可高效计算的编码保真度度量,其与理论指标(如模糊度和偏差)高度一致。
  • 该方法通过聚焦于与顺序无关的聚合统计量,避免了昂贵的推理过程,因而适用于性能调优、入侵检测和查询推荐等任务。

实验结果

研究问题

  • RQ1能否设计一种有损压缩方案,在保证压缩效率的同时,实现查询日志摘要的紧凑性与保真度之间的平衡?
  • RQ2重构误差是否可作为模糊度和偏差等经典保真度度量的可靠且高效的代理?
  • RQ3基于聚类的模式混合编码能否在不损失准确性的前提下,显著缩小最优日志摘要的搜索空间?
  • RQ4LogR 在性能与准确性方面相较于现有最先进的基于模式的摘要技术表现如何?
  • RQ5生成的压缩摘要是否既能支持机器高效处理,又能实现人工可读,以支持数据库管理任务?

主要发现

  • LogR 在工作负载摘要任务中实现了比现有最先进模式编码算法更快的压缩速度和更高的精度。
  • 重构误差与经典保真度度量高度相关,使其成为评估日志编码的可靠且高效替代方案。
  • 朴素混合编码(即独立压缩每个聚类)所产生的结果,与更复杂的优化技术相比具有竞争力。
  • 基于聚类的模式混合编码方法显著缩小了最优编码的搜索空间,从而实现了可扩展且高效的摘要构建。
  • LogR 压缩后的日志保留了关键的工作负载统计特性,包括可能对性能产生重大影响的稀有查询,避免了简单采样的缺陷。
  • 压缩摘要既具备机器处理效率,又支持人工可读性,可同时支持自动化分析与专家审查。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。