Skip to main content
QUICK REVIEW

[論文レビュー] Succinctness of the Complement and Intersection of Regular Expressions

Wouter Gelade, Frank Neven|Feb 20, 2008
semigroups and automata theory参考文献 29被引用数 8
ひとこと要約

この論文は、正規表現の補集合と積集合に関する記述の簡潔さのタイトな下界を確立し、正規表現の補集合化には二重指数的サイズ増加が生じ得ることを証明している。また、k 個の正規表現の積集合は、k が有界でない場合、二重指数的爆発が生じ得る。著者は、これらの下界が避けられないことを示す明示的な正規表現の族を構築し、一方で1-非決定的正規表現では補集合化が多項式時間で計算可能であるが、積集合は依然として指数的困難であることを示している。

ABSTRACT

We study the succinctness of the complement and intersection of regular expressions. In particular, we show that when constructing a regular expression defining the complement of a given regular expression, a double exponential size increase cannot be avoided. Similarly, when constructing a regular expression defining the intersection of a fixed and an arbitrary number of regular expressions, an exponential and double exponential size increase, respectively, can in worst-case not be avoided. All mentioned lower bounds improve the existing ones by one exponential and are tight in the sense that the target expression can be constructed in the corresponding time class, i.e., exponential or double exponential time. As a by-product, we generalize a theorem by Ehrenfeucht and Zeiger stating that there is a class of DFAs which are exponentially more succinct than regular expressions, to a fixed four-letter alphabet. When the given regular expressions are one-unambiguous, as for instance required by the XML Schema specification, the complement can be computed in polynomial time whereas the bounds concerning intersection continue to hold. For the subclass of single-occurrence regular expressions, we prove a tight exponential lower bound for intersection.

研究の動機と目的

  • 与えられた正規表現の補集合を表す正規表現を構築する際の最悪ケースでのサイズ増加を特定すること。
  • 特に、固定された数と任意の数の正規表現の積集合の記述の簡潔さを分析すること。
  • 補集合化や積集合化がより効率的に行えるような自然な正規表現の部分クラス(例:1-非決定的、または1回出現のみの正規表現)を同定すること。
  • EhrenfeuchtとZeigerのDFAから正規表現への記述の簡潔さに関する結果を、固定された4文字のアルファベットに一般化すること。
  • 既知のアルゴリズムの実行時間と一致するタイトな複雑性境界を提供し、最適性を確立すること。

提案手法

  • Ehrenfeucht-Zeiger言語 $Z_n$ の2進表現を符号化することで、4文字のアルファベット上に言語 $K_n$ の族を構築する。これらはサイズ $\mathcal{O}(n^2)$ のDFAで受理可能だが、正規表現では少なくとも $2^n$ のサイズを要する。
  • $\mathcal{O}(n^2)$ のサイズを持つ2つの正規表現 $r_n$ と $s_n$ を定義し、それらの積集合が $M_n$ に等しくなるようにする。$M_n$ は少なくとも $2^{n-1}$ のサイズを要する正規表現を必要とするため、積集合の指数的下界を示す。
  • $m = 2n+1$ 個の1-非決定的正規表現を、サイズ $\mathcal{O}(n)$ で構築し、それらの積集合が $L_{2^n}$ を定義する。$L_{2^n}$ は少なくとも $2^{2^n}$ のサイズを要する正規表現を必要とするため、この部分クラスにおける積集合の二重指数的下界を確立する。
  • Glushkov構成法を用いて、構築された1-非決定的正規表現が決定的有限オートマトンを生成することを検証し、構造的性質を確認する。
  • 1-非決定的正規表現の補集合は多項式時間で計算可能であるが、一般の補集合は二重指数的であることを証明する。
  • 補集合および積集合の正規表現を構築する際の時間計算量の境界を提示し、下界がタイトであり、標準的アルゴリズムの時間計算量と一致することを示す。

実験結果

リサーチクエスチョン

  • RQ1与えられた正規表現の補集合を表す正規表現を構築する際の最小サイズ増加は何か?
  • RQ2k 個の正規表現の積集合を計算する際の最小サイズ増加は何か。特に、k が固定されている場合と無限大に近づく場合について。
  • RQ3自然な正規表現の部分クラスにおいて、補集合演算を多項式時間で計算可能か。そのようなクラスは何か?
  • RQ4固定された小さなアルファベット(例:4文字)におけるDFAと正規表現の間の正確な記述の簡潔さのギャップは何か?
  • RQ5補集合と積集合の両方が多項式時間で計算可能な正規表現の部分クラスは存在するか?

主な発見

  • 正規表現の補集合化は最悪ケースで二重指数的サイズ増加を要し、この下界はタイトである。これより小さい正規表現では補集合を定義できない。
  • k 個の正規表現の積集合は、k が有界でない場合、二重指数的サイズ増加を要し、この下界もタイトである。
  • 固定された数 k 個の正規表現の積集合は、指数的時間で計算可能であり、これは最適である。最悪ケースでは指数的サイズ増加を避けられない。
  • 1-非決定的正規表現では、補集合は多項式時間で計算可能であるが、結果の正規表現は1-非決定的でなくなる可能性がある。
  • 1回出現のみの正規表現では、積集合演算により指数的サイズ増加が生じるが、この下限はタイトである。
  • サイズ $\mathcal{O}(n)$ の1-非決定的正規表現の族が存在し、それらの積集合は少なくとも $2^{2^n}$ のサイズを要する正規表現を必要とする。これにより、二重指数的爆発が生じることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。