[论文解读] The similarity metric
本文提出归一化信息距离(NID),一种基于柯尔莫哥洛夫复杂性的通用相似性度量,可最小化所有可计算的相似性距离。该文引入归一化压缩距离(NCD)作为使用标准压缩器的实用近似方法,成功实现了全自动化线粒体基因组系统发育树构建与52种语言家族树的生成,展示了在无需领域特定参数的情况下,跨多种领域的稳健性。
A new class of distances appropriate for measuring similarity relations between sequences, say one type of similarity per distance, is studied. We propose a new ``normalized information distance'', based on the noncomputable notion of Kolmogorov complexity, and show that it is in this class and it minorizes every computable distance in the class (that is, it is universal in that it discovers all computable similarities). We demonstrate that it is a metric and call it the {\em similarity metric}. This theory forms the foundation for a new practical tool. To evidence generality and robustness we give two distinctive applications in widely divergent areas using standard compression programs like gzip and GenCompress. First, we compare whole mitochondrial genomes and infer their evolutionary history. This results in a first completely automatic computed whole mitochondrial phylogeny tree. Secondly, we fully automatically compute the language tree of 52 different languages.
研究动机与目标
- 开发一种无需领域特定知识或特征的通用相似性数学理论。
- 定义一种捕捉序列之间所有可计算相似性关系的通用距离度量。
- 证明该度量在生物信息学和计算语言学等实际领域中的适用性。
- 通过标准压缩算法提供非可计算的NID的实用、可计算近似。
- 通过自动构建进化和语言系统发育树来验证该方法。
提出的方法
- 提出基于柯尔莫哥洛夫复杂性的归一化信息距离(NID)作为通用度量,定义为两个对象之间条件复杂性的归一化和。
- 引入归一化压缩距离(NCD)作为NID的实用近似,使用gzip和GenCompress等真实世界的压缩器。
- 通过公式计算NCD:NCD(x,y) = [C(xy) - min(C(x), C(y))]/max(C(x), C(y)),其中C(z)表示z的压缩大小。
- 将NCD应用于序列的层次聚类,实现系统发育树和语言树的自动构建。
- 在语言树构建中使用巴斯克语作为外群,以确保与已知语言家族的独立性。
- 使用标准压缩程序,无需调参或特征工程,确保无参数的数据挖掘。
实验结果
研究问题
- RQ1能否定义一种通用相似性度量,以捕捉序列之间所有可计算的相似性关系?
- RQ2归一化信息距离(NID)是否为有效度量,满足三角不等式及其他度量性质?
- RQ3NID的实用近似——即NCD——能否用于从原始序列数据中自动推断进化和语言关系?
- RQ4NCD在无需先验领域知识的情况下,重建已知生物和语言系统发育树的性能如何?
- RQ5该方法在基因组学和语言学等截然不同的领域中是否仍保持稳健?
主要发现
- 证明了归一化信息距离(NID)是一种度量,满足所有度量性质,包括三角不等式。
- NID具有普遍性,即它在有效相似性度量类中最小化所有可计算距离。
- 归一化压缩距离(NCD)成功实现了全自动化线粒体基因组系统发育树的重建,与已知的进化关系一致。
- NCD方法生成了52种欧亚语言的语言树,其结果与历史和语言学分类一致,将英语置于罗曼语和凯尔特语之间,并将匈牙利语与突厥语系语言隔离。
- 结果在单次运行中获得,无需参数调优,展示了方法在不同领域中的稳健性和泛化能力。
- 与临时性压缩方法相比,该方法表现更优,避免了任意的三角化处理,且无理论依据的压缩方法缺乏合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。