Skip to main content
QUICK REVIEW

[논문 리뷰] The similarity metric

Ming Li, Xin Chen|arXiv (Cornell University)|2001. 11. 20.
Computability, Logic, AI Algorithms참고 문헌 25인용 수 7
한 줄 요약

이 논문은 콜모고로프 복잡도에 기반한 유니버설 유사도 측정 기준인 정규화된 정보 거리(NID)를 제안한다. NID는 모든 계산 가능한 유사도 거리들을 포함하는 유일한 기준이며, 표준 압축기기를 사용하는 실용적 근사치인 정규화된 압축 거리(NCD)를 도입하여, 도메인 특화 매개변수 없이 유전자 및 언어 분야에서의 자동화된 미토콘드리아 게놈 계통수 및 52개 언어 가문의 계통수를 성공적으로 생성하였다. 이는 다양한 분야에 걸쳐 강건성을 보여준다.

ABSTRACT

A new class of distances appropriate for measuring similarity relations between sequences, say one type of similarity per distance, is studied. We propose a new ``normalized information distance'', based on the noncomputable notion of Kolmogorov complexity, and show that it is in this class and it minorizes every computable distance in the class (that is, it is universal in that it discovers all computable similarities). We demonstrate that it is a metric and call it the {\em similarity metric}. This theory forms the foundation for a new practical tool. To evidence generality and robustness we give two distinctive applications in widely divergent areas using standard compression programs like gzip and GenCompress. First, we compare whole mitochondrial genomes and infer their evolutionary history. This results in a first completely automatic computed whole mitochondrial phylogeny tree. Secondly, we fully automatically compute the language tree of 52 different languages.

연구 동기 및 목표

  • 도메인 특화 지식이나 특징이 필요 없는 일반적인 수학적 유사도 이론을 개발하기 위해.
  • 시퀀스 간 모든 계산 가능한 유사도 관계를 포괄하는 유니버설 거리 측정 기준을 정의하기 위해.
  • 이 측정 기준이 생물정보학 및 계산 언어학과 같은 실제 도메인에서의 적용 가능성을 입증하기 위해.
  • 비계산 가능한 NID의 실용적이고 계산 가능한 근사치를 표준 압축 알고리즘을 사용해 제공하기 위해.
  • 진화적 및 언어 계통수 트리를 자동으로 구성함으로써 방법의 타당성을 검증하기 위해.

제안 방법

  • 콜모고로프 복잡도에서 유도된 유니버설 측정 기준인 정규화된 정보 거리(NID)를 제안하며, 이는 두 객체 간 조건부 복잡도의 정규화된 합으로 정의된다.
  • 실제 압축기기인 gzip과 GenCompress를 사용하여 NID의 실용적 근사치인 정규화된 압축 거리(NCD)를 도입한다.
  • NCD는 공식 NCD(x,y) = [C(xy) - min(C(x), C(y))]/max(C(x), C(y))를 통해 계산되며, 여기서 C(z)는 z의 압축 크기이다.
  • NCD를 사용해 시퀀스의 계층적 군집화를 수행함으로써, 자동으로 계통수 및 언어 트리를 구성할 수 있다.
  • 언어 트리 구성 시 알려진 언어 가문과의 독립성을 확보하기 위해 바스크어를 아웃그룹으로 사용한다.
  • 조정 없이 표준 압축 프로그램을 사용함으로써 매개변수 없는 데이터 마이닝을 보장한다.

실험 결과

연구 질문

  • RQ1모든 계산 가능한 시퀀스 간 유사도 관계를 포괄하는 유니버설 유사도 측정 기준을 정의할 수 있는가?
  • RQ2정규화된 정보 거리(NID)는 삼각 부등식 및 기타 거리 측정 성질을 만족하는 타당한 거리 측정 기준인가?
  • RQ3NID의 실용적 근사치인 NCD를 사용해 원시 시퀀스 데이터에서 진화적 및 언어적 관계를 자동으로 유추할 수 있는가?
  • RQ4이 방법은 사전 도메인 지식 없이 기존의 생물학적 및 언어 계통수를 얼마나 잘 재구성하는가?
  • RQ5유전체학 및 언어학 등 매우 다른 도메인 간에도 이 방법은 강건한가?

주요 결과

  • 정규화된 정보 거리(NID)는 삼각 부등식을 포함한 모든 거리 측정 성질을 만족함이 증명되었다.
  • NID는 모든 계산 가능한 거리 측정 기준을 포함하는 의미에서 유니버설하다.
  • 정규화된 압축 거리(NCD)는 자동으로 전체 미토콘드리아 게놈 계통수 트리를 재구성하여 알려진 진화적 관계와 일치함을 입증하였다.
  • NCD 방법은 유럽-아시아 52개 언어의 언어 트리를 생성하였으며, 역사적 및 언어학적 분류와 일치하여 영어를 라틴어계 및 Cellic 언어 사이에 위치시키고 헝가리어를 투르크어계 언어와 분리시켰다.
  • 매개변수 조정 없이 단일 실행으로 결과를 도출하여, 다양한 도메인 간 강건성과 일반화 능력을 입증하였다.
  • 이론적 근거가 없는 임의의 삼각화를 피하고, 특수한 압축 기반 접근법보다 우수한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.