QUICK REVIEW
[论文解读] Learning Pairwise Disjoint Simple Languages from Positive Examples
Alexis Linard, Rick Smetsers|arXiv (Cornell University)|Jun 6, 2017
Algorithms and Data Compression参考文献 6被引用 3
一句话总结
本文提出两种基于压缩的聚类方法,从仅含正例的数据中学习成对不相交的简单正则语言,利用打泵引理分解和串行重复结构,按共享的结构模式对字符串进行分组。该方法成功识别了工业打印机数据中的不同打印作业模式,展示了在真实场景中进行语言发现的实用价值。
ABSTRACT
A classical problem in grammatical inference is to identify a deterministic finite automaton (DFA) from a set of positive and negative examples. In this paper, we address the related - yet seemingly novel - problem of identifying a set of DFAs from examples that belong to different unknown simple regular languages. We propose two methods based on compression for clustering the observed positive examples. We apply our methods to a set of print jobs submitted to large industrial printers.
研究动机与目标
- 解决仅提供正例而无负例时,学习多个成对不相交正则语言的挑战。
- 发现属于不同简单正则语言的字符串所蕴含的底层结构模式,如重复模式或串行重复。
- 开发基于共享打泵分解的聚类方法,实现无需预先标注的语言推断。
- 将该方法应用于实际工业数据——大规模打印机的打印作业,其中每个作业属于一个独立的简单语言类别。
- 在包含23,000多个打印作业的数据集上验证该方法,成功恢复出如(ab)+、(abc)+和a(bc)+a等语言模式。
提出的方法
- 利用打泵引理识别字符串可能的分解形式uv^i w,其中v为可重复的子串(可打泵)。
- 从字符串中提取串行重复作为候选重复单元,将其视为聚类的结构特征标识。
- 应用基于压缩的相似性度量(例如使用码字长度函数)比较字符串,将具有相似分解的字符串分组。
- 从uv^{≥2}w到uv^{+}w再到uv^{*}w,对分解进行分层泛化,实现在不同抽象层次上的渐进聚类。
- 使用等价性检查验证同一语言的不同表示(如a(baa)+b与ab(aab)+)是否描述同一语言。
- 基于共享的打泵分解和串行重复结构进行聚类,将每个字符串分配至相应的语言族。
实验结果
研究问题
- RQ1我们能否仅从正例中学习多个成对不相交的正则语言,而无需负例?
- RQ2基于打泵引理的分解和串行重复能否作为可靠结构特征,用于将字符串聚类至不同语言?
- RQ3基于压缩的相似性度量在将属于同一简单正则语言的字符串分组方面有多有效?
- RQ4该方法能否从真实工业打印作业数据中恢复出有意义且可被人类理解的语言模式(如(ab)+、a(bc)+a)?
- RQ5语言的简单性对所提聚类方法成功的影响如何?
主要发现
- 该方法成功从超过23,000个字符串的数据集中识别出12种不同的打印作业模式,包括(ab)+、(abc)+和a(bc)+a。
- 具有相同串行重复或打泵分解的字符串始终被分入同一语言聚类,表明结构的一致性。
- 基于压缩的相似性度量有效捕捉了共享的结构模式,实现了无需标注数据的准确聚类。
- 从uv^{≥2}w到uv^{*}w的分解分层泛化,使方法在不同重复层级上均能实现稳健聚类。
- 该方法在工业环境中展现出实际可行性,成功从真实世界打印作业序列中恢复出可解释的语言模式。
- 等价性检查确认,同一语言的不同表示(如a(baa)+b与ab(aab)+)被正确识别为等价。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。