Skip to main content
QUICK REVIEW

[論文レビュー] Query Log Compression for Workload Analytics

Ting Xie, Oliver Kennedy|arXiv (Cornell University)|Sep 2, 2018
Advanced Database Systems and Queries参考文献 37被引用数 3
ひとこと要約

この論文では、パターンベースの符号化とクラスタリングを用いて、分析に適したデータベースワークロードを効率的に要約する、損失ありクエリログ圧縮方式LogRを提案する。忠実度の計算的に効率的な代理指標として再現誤差を導入することで、最先端の手法よりも高速かつ高精度にワークロード要約を実現するとともに、機械的・人的解釈の両方が可能になる。

ABSTRACT

Analyzing database access logs is a key part of performance tuning, intrusion detection, benchmark development, and many other database administration tasks. Unfortunately, it is common for production databases to deal with millions or even more queries each day, so these logs must be summarized before they can be used. Designing an appropriate summary encoding requires trading off between conciseness and information content. For example: simple workload sampling may miss rare, but high impact queries. In this paper, we present LogR, a lossy log compression scheme suitable use for many automated log analytics tools, as well as for human inspection. We formalize and analyze the space/fidelity trade-off in the context of a broader family of "pattern" and "pattern mixture" log encodings to which LogR belongs. We show through a series of experiments that LogR compressed encodings can be created efficiently, come with provable information-theoretic bounds on their accuracy, and outperform state-of-art log summarization strategies.

研究の動機と目的

  • 直接処理が困難な巨大スケールのデータベースクエリログを分析する課題に対処すること。
  • 特にレアだが高い影響を持つクエリを含め、ワークロードの重要な統計的特性を保持する損失あり圧縮方式を設計すること。
  • 古典的指標(アンビグアティーやデバイエーションなど)と強く相関する、符号化忠実度を計算的に効率的に測定する指標を考案すること。
  • クラスタリングに基づくパターンミックスイング符号化を用いて、最適なログ要約の探索空間を縮小すること。
  • 精度および効率の両面で、既存の最先端のログ要約技術を上回ること。

提案手法

  • LogRは、SELECT、FROM、WHERE句などの構造的要素に基づいて、クエリをビットベクトル特徴ベクトルとして表現する。
  • 頻繁に共起する構造的要素(パターン)をその頻度とともにマッピングする、パターン符号化の族を導入する。
  • すべての可能な符号化の最適化が計算的に非現実的であることを踏まえ、ログをグループに分割するクラスタリングを用いて、パターンミックスイング符号化を可能にする。
  • 各クラスタを個別にその固有のパターン符号化で圧縮する、簡素化されたアプローチであるナイーブミックスイング符号化を提案する。
  • 再現誤差を、理論的指標(アンビグアティーやデバイエーションなど)と密接に追跡する実用的で計算が効率的な符号化忠実度の測定指標として導入する。
  • 推論に高コストがかかるのを避けるために、順序に依存しない集計統計に焦点を当てることで、パフォーマンスチューニング、インシデント検出、クエリ推薦に適した手法を実現する。

実験結果

リサーチクエスチョン

  • RQ1計算効率を保ちつつ、要約のコンパクトさと忠実度のバランスを取れる損失あり圧縮方式を設計できるか?
  • RQ2再現誤差は、アンビグアティーやデバイエーションといった古典的忠実度指標の信頼できるかつ効率的な代理指標として機能するか?
  • RQ3クラスタリングに基づくパターンミックスイング符号化は、精度を損なわずに最適なログ要約の探索空間を顕著に縮小できるか?
  • RQ4LogRは、最先端のパターンベース要約技術と比較して、性能および精度の両面で優れているか?
  • RQ5得られる圧縮要約は、機械的処理と人的解釈の両方に適しているか、データベース管理タスクに有効か?

主な発見

  • LogRは、ワークロード要約タスクにおいて、最先端のパターン符号化アルゴリズムよりも圧縮が高速で、精度が高くなる。
  • 再現誤差は古典的忠実度指標と強く相関しており、ログ符号化の評価に信頼的かつ効率的な代替手段であることが示された。
  • 各クラスタを独立に圧縮するナイーブミックスイング符号化は、より複雑な最適化手法と同等の結果を達成する。
  • クラスタリングに基づくパターンミックスイング符号化アプローチは、最適な符号化の探索空間を顕著に縮小し、スケーラブルかつ効率的な要約構築を可能にする。
  • LogRで圧縮されたログは、パフォーマンスに顕著な影響を与える可能性のあるレアなクエリを含む、重要なワークロード統計を保持しており、単純なサンプリングの欠陥を回避する。
  • 圧縮された要約は、機械的処理にも適しており、同時に人的に解釈可能であり、自動分析とエキスパートによる検査の両方を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。