[论文解读] Closures in Formal Languages and Kuratowski's Theorem
本文研究形式语言在Kleene闭包与正闭包运算下的闭包性质,将Kuratowski的经典拓扑闭包与补集定理由拓扑空间推广至形式语言理论。通过重复应用补集与闭包运算所生成的代数对语言进行分类,证明在Kleene闭包下恰好存在12种不同的代数,在正闭包下恰好存在9种不同的代数,且生成语言数量的上界严格(最多14个)。
A famous theorem of Kuratowski states that in a topological space, at most 14 distinct sets can be produced by repeatedly applying the operations of closure and complement to a given set. We re-examine this theorem in the setting of formal languages, where closure is either Kleene closure or positive closure. We classify languages according to the structure of the algebra they generate under iterations of complement and closure. We show that there are precisely 9 such algebras in the case of positive closure, and 12 in the case of Kleene closure.
研究动机与目标
- 将Kuratowski的经典14集合定理由拓扑空间推广至形式语言理论,以Kleene闭包或正闭包替代拓扑闭包。
- 在形式语言设定下,对重复应用补集与闭包运算所生成的所有可能代数进行分类。
- 确定每种闭包类型下不同代数的确切数量,以及生成语言的最大数量。
- 为每种代数类型提供显式语言示例,以证明上界的紧致性。
提出的方法
- 将Kleene闭包(L∗= ⋃i≥0 Li)与正闭包(L+= ⋃i≥1 Li)定义为所有有限词串集合Σ∗上的闭包算子。
- 利用闭包算子与内部算子之间的对偶性:L⊛ = L−∗−(Kleene内部),L⊕ = L−+−(正内部)。
- 基于闭包与内部算子,将语言分类为开集、闭集、既开又闭集或两者皆非。
- 分析由语言L在闭包、补集及其迭代作用下生成的代数E(L)的结构。
- 使用同态φ将E(L)中的语言映射到其基集B(L),以降低复杂度并实现分类。
- 基于空字ǫ的状态,以及L及其衍生集合的开闭性,进行情形分析,以枚举所有可能的代数。
实验结果
研究问题
- RQ1对单一形式语言反复应用补集与Kleene闭包运算,最多能生成多少种不同的语言?
- RQ2语言的何种结构特性决定了在闭包与补集运算下所生成代数的大小与组成?
- RQ3空字ǫ的存在与否如何影响所生成语言集合的代数结构?
- RQ4在正闭包与Kleene闭包下是否存在不同的代数类型?若有,各有多少种?
- RQ5能否建立生成语言数量的紧致上界?这些上界是否可达?
主要发现
- 在Kleene闭包下,任何语言通过重复应用Kleene闭包与补集运算,恰好生成12种不同的代数,最多生成14种不同的语言。
- 在正闭包下,恰好生成9种不同的代数,最多生成14种语言,但其结构与Kleene闭包情形不同。
- Kleene闭包下14种语言的上界是紧致的,如在情形(9)中,语言a ∪ ab ∪ bb恰好生成14种不同的语言。
- 代数的结构关键取决于语言是否为开集、闭集、既开又闭集或两者皆非,以及空字ǫ是否存在。
- 当语言L为既开又闭集且包含ǫ时,所生成代数的大小为2;当L为既开又闭集但不包含ǫ时,代数大小仍为2,但其代数结构与前一情形对偶。
- 在L既非开也非闭的情形下,代数大小在4至14之间变化,具体取决于L+与L⊕的闭包与开集性质,当L+与L⊕均既非闭集也非开集,且其闭包不同时,代数大小达到最大值14。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。