Skip to main content
QUICK REVIEW

[論文レビュー] Tree Compression with Top Trees

Philip Bille, Inge Li Goertz|arXiv (Cornell University)|Apr 21, 2013
Algorithms and Data Compression参考文献 21被引用数 7
ひとこと要約

この論文は、根付き部分木の繰り返しのみを活用する従来のDAG圧縮とは異なり、木のパターンの繰り返し(任意の連結部分グラフ)を活用する新しい方式、トップツリー圧縮を提案する。トップツリーを用いて圧縮された木を効率的に表現・走査することで、近似的に最適な圧縮が達成され、対数時間オーダーのナビゲーションクエリが可能となり、DAG圧縮よりも指数関数的に優れた圧縮が可能になる一方、最悪の場合でも対数的要因以内に劣ることはない。

ABSTRACT

We introduce a new compression scheme for labeled trees based on top trees. Our compression scheme is the first to simultaneously take advantage of internal repeats in the tree (as opposed to the classical DAG compression that only exploits rooted subtree repeats) while also supporting fast navigational queries directly on the compressed representation. We show that the new compression scheme achieves close to optimal worst-case compression, can compress exponentially better than DAG compression, is never much worse than DAG compression, and supports navigational queries in logarithmic time.

研究の動機と目的

  • DAG圧縮には根付き部分木の繰り返ししか活用できないという限界を解消し、特に単一パス木のような内部構造が高頻度で繰り返される木構造を効果的に圧縮できない問題に対処すること。
  • 任意の連結部分グラフ(木パターン)の繰り返しを活用する圧縮方式を開発し、木構造におけるより多くの構造的冗長性を捉えること。
  • 親、ラベル、サイズ、深さなどのナビゲーションクエリを、圧縮表現上で保証された対数時間オーダーで実行可能にすること。
  • 最悪ケースにおいても最適に近い圧縮比を達成し、DAG圧縮よりも最悪で対数的要因以上に劣ることのない、証明可能な圧縮比を達成すること。
  • 木パターンの繰り返しを活用することで、部分木の繰り返しに基づくDAG圧縮よりも指数関数的に優れた圧縮が可能になること、特に繰り返しの多い木構造で顕著であることを示すこと。

提案手法

  • 本手法は、各クラスタが共有構造を持つ連結部分グラフに対応する、クラスタの階層的分解として圧縮木をトップツリーで表現する。
  • ノードの部分木を表すクラスタの集合を特定するための手続き、FindRepresentativesを導入し、トップツリー分解の上方向および下方向の走査を実行する。
  • 各クラスタに対して、マージ情報と構造的メタデータ(例:高さ、サイズ、境界ノード)を格納することで、効率的なクエリ操作を可能にする。
  • 親、次の兄弟、サイズ、深さなどのナビゲーションクエリは、クラスタ分解と格納されたメタデータを用いて計算され、O(log n)の時間計算量を達成する。
  • 関連するクラスタを展開し、トップツリー構造に格納されたマージ規則を用いて組み合わせることで、任意の部分木の復元が可能である。
  • 本方式は空間効率的であり、完全な復元なしに、圧縮構造上でパスクエリや部分木クエリを直接実行可能である。

実験結果

リサーチクエスチョン

  • RQ1木パターンの繰り返し(任意の連結部分グラフ)を活用する圧縮方式は、根付き部分木の繰り返しのみを活用するDAG圧縮よりも、最悪ケースの圧縮性能が優れているか?
  • RQ2任意の木パターンの繰り返しを活用する圧縮木表現に対しても、親、サイズ、深さなどのナビゲーションクエリを対数時間オーダーで効率的に実行可能か?
  • RQ3提案手法の圧縮比は、DAG圧縮と比較して、最悪ケースの保証と指数的改善の観点からどの程度か?
  • RQ4本新方式は空間効率的であり、木文法ベースのアプローチで一般的な指数的クエリ時間と比較して、高速なクエリを実現できるか?
  • RQ5木パターン繰り返しに基づく方式と、部分木繰り返しに基づくDAG圧縮のような方式との間には、圧縮力に証明可能な差があるか?

主な発見

  • トップツリー圧縮方式は、木パターン繰り返しを活用するあらゆる方式において、最悪ケースで logσ^0.19 n の圧縮比を達成するという、初めての証明可能な下界を達成した。
  • 本方式は、特にラベルが同一の単一パス木のような高頻度の内部繰り返しを持つ木構造において、DAG圧縮よりも指数関数的に優れた圧縮が可能である。
  • 本方式は、DAG圧縮よりも最悪で対数的要因以上に劣ることはないため、あらゆる木構造で安定したパフォーマンスを発揮する。
  • 親、サイズ、深さ、ラベルなどのすべてのナビゲーションクエリが、圧縮表現上でO(log n)時間でサポートされ、木文法ベースの手法と比較して顕著な改善が得られた。
  • 任意の部分木T(x)の復元は、O(log n + |T(x)|)時間で実行可能であり、効率的なクラスタ照合と局所的展開が組み合わされている。
  • 予備実験の結果、一般的なXMLデータセットにおいてトップツリー圧縮は標準的なDAG圧縮を上回ることが確認されたが、バランスの取れた木構造ではわずかな利点にとどまった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。