Skip to main content
QUICK REVIEW

[論文レビュー] String Attractors and Combinatorics on Words

Sabrina Mantaci, Antonio Restivo|arXiv (Cornell University)|Jul 10, 2019
Algorithms and Data Compression参考文献 23被引用数 4
ひとこと要約

この論文は、有限および無限語の組合せ的分析のための文字列アトラクタを考察し、標準的ストゥルミアン語がサイズ2の最小文字列アトラクタを持つこと、トゥエ=モルス語が対数的サイズのアトラクタ(最小と仮定されている)を持つこと、およびデュ・ブリジン語が $ n / \log n $ に漸近的に成長するアトラクタサイズを示すことを示している。本研究は、アトラクタサイズと語の複雑さの間の関係を確立し、組合せ的語の分析のための新しい測度を提案する。

ABSTRACT

The notion of \emph{string attractor} has recently been introduced in [Prezza, 2017] and studied in [Kempa and Prezza, 2018] to provide a unifying framework for known dictionary-based compressors. A string attractor for a word $w=w[1]w[2]\cdots w[n]$ is a subset $Γ$ of the positions $\{1,\ldots,n\}$, such that all distinct factors of $w$ have an occurrence crossing at least one of the elements of $Γ$. While finding the smallest string attractor for a word is a NP-complete problem, it has been proved in [Kempa and Prezza, 2018] that dictionary compressors can be interpreted as algorithms approximating the smallest string attractor for a given word. In this paper we explore the notion of string attractor from a combinatorial point of view, by focusing on several families of finite words. The results presented in the paper suggest that the notion of string attractor can be used to define new tools to investigate combinatorial properties of the words.

研究の動機と目的

  • 標準的ストゥルミアン語、トゥエ=モルス語、およびデュ・ブリジン語における文字列アトラクタの組合せ的性質を調査すること。
  • 標準的ストゥルミアン語、トゥエ=モルス語、およびデュ・ブリジン語の最小文字列アトラクタのサイズを特定すること。
  • アトラクタ位置の分布と構造が、語のより深い組合せ的特徴を反映しているかどうかを調査すること。
  • 文字列アトラクタサイズを語の複雑度の新たな測度として提案すること。
  • 自己写像生成語およびアトラクタ分布に関する新しい研究方向性を提示すること。

提案手法

  • 論文は、語のすべての異なる部分語が、集合内の少なくとも1つの位置を通過するような位置の集合として文字列アトラクタを定義する。
  • 辞書圧縮およびバーローズ=ウィリヤムズ変換に関する既知の結果を応用して、アトラクタサイズを束縛する。
  • 標準的ストゥルミアン語の場合、因子化の性質と共役構造を活用して、2つの連続する位置からなるサイズ2の最小アトラクタを示す。
  • トゥエ=モルス語の場合、語の再帰的構造に基づいて、サイズ $ \log n $ の文字列アトラクタの構成が提供される。
  • デュ・ブリジン語の場合、LZ分解の境界と、すべての $ k $-長さの部分語が正確に1回だけ現れるという事実を組み合わせることで、アトラクタサイズの漸近的境界が導かれる。
  • LZパースィングに関する定理7.1および7.2を用いて理論的境界が導かれ、$ n + k - 1 $ の長さのデュ・ブリジン語に対して $ \frac{n}{\log n} \leq \gamma^* \leq \frac{n}{(1 - \epsilon_n)\log n} + 1 $ が得られる。

実験結果

リサーチクエスチョン

  • RQ1標準的ストゥルミアン語の最小文字列アトラクタのサイズは何か? そして、それは組合せ的に特徴づけられるか?
  • RQ2トゥエ=モルス語の $ \log n $ サイズの文字列アトラクタは最小か? その語の構造的性質はこの事実をどのように支持するか?
  • RQ3デュ・ブリジン語の最小文字列アトラクタのサイズはどのように成長するか? これは圧縮可能性および構造にどのような含意を持つのか?
  • RQ4最小文字列アトラクタ内の位置の分布は、語の組合せ的複雑度に関するインサイトを明らかにできるか?
  • RQ5自己写像生成と無限語における最小文字列アトラクタのサイズとの関係は何か?

主な発見

  • 任意の標準的ストゥルミアン語の最小文字列アトラクタのサイズは正確に2であり、2つの連続する位置から構成される。
  • 長さ $ n $ のトゥエ=モルス語に対して、サイズ $ \log n $ の文字列アトラクタが存在し、著者らはこれが最小であると仮定している。
  • アルファベットサイズ $ \sigma $ の下で $ k $ 階のデュ・ブリジン語に対して、最小文字列アトラクタのサイズは $ \frac{n}{\log n} $ に漸近的に成長する。ここで $ n = \sigma^k $ である。
  • デュ・ブリジン語に対して下界 $ \frac{n}{\log n} $ が得られるのは、すべての $ k $-長さの部分語が正確に1回だけ現れるためであり、アトラクタ位置間の最大距離が制限されるからである。
  • デュ・ブリジン語の最小文字列アトラクタの上界は $ \frac{n}{(1 - \epsilon_n)\log n} + 1 $ であり、ここで $ \epsilon_n = 2\frac{1 + \log(\log(\sigma n))}{\log n} $ である。
  • 結果から、アトラクタ位置の分布そのものが、サイズのみならず組合せ的意義を有する可能性があることが示唆され、複雑度分析の新たな道が開かれる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。