Skip to main content
QUICK REVIEW

[논문 리뷰] Information Theory and the Length Distribution of all Discrete Systems

Les Hatton, Gregory W. Warr|arXiv (Cornell University)|2017. 09. 06.
Statistical Mechanics and Entropy참고 문헌 41인용 수 6
한 줄 요약

이 논문은 보존된 하틀리-샤논 정보(Conservation of Hartley-Shannon Information, CoHSI)가 단백질, 소프트웨어 기능, 음악적 구성 등 다양한 이산 체계에서 관찰된 보편적인 길이 분포의 힘의 법칙을 설명함을 제안한다. 이는 공통의 알파벳을 공유하는 이질적 체계는 단일 최빈값을 가지며 꼬리가 힘의 법칙을 따르는 분포를, 반면 각 구성 요소가 고유 토큰 세트를 사용하는 동질적 체계는 지프의 법칙을 따름을 보여줌으로써 이루어진다. 이 이론은 생물학적 진화와 인간 설계 시스템 간의 긴장된 유사성을 설명하며, 생물학, 소프트웨어, 음악 분야에서 고도의 통계적 유의성을 확보하여 검증되었다.

ABSTRACT

We begin with the extraordinary observation that the length distribution of 80 million proteins in UniProt, the Universal Protein Resource, measured in amino acids, is qualitatively identical to the length distribution of large collections of computer functions measured in programming language tokens, at all scales. That two such disparate discrete systems share important structural properties suggests that yet other apparently unrelated discrete systems might share the same properties, and certainly invites an explanation. We demonstrate that this is inevitable for all discrete systems of components built from tokens or symbols. Departing from existing work by embedding the Conservation of Hartley-Shannon information (CoHSI) in a classical statistical mechanics framework, we identify two kinds of discrete system, heterogeneous and homogeneous. Heterogeneous systems contain components built from a unique alphabet of tokens and yield an implicit CoHSI distribution with a sharp unimodal peak asymptoting to a power-law. Homogeneous systems contain components each built from just one kind of token unique to that component and yield a CoHSI distribution corresponding to Zipf's law. This theory is applied to heterogeneous systems, (proteome, computer software, music); homogeneous systems (language texts, abundance of the elements); and to systems in which both heterogeneous and homogeneous behaviour co-exist (word frequencies and word length frequencies in language texts). In each case, the predictions of the theory are tested and supported to high levels of statistical significance. We also show that in the same heterogeneous system, different but consistent alphabets must be related by a power-law. We demonstrate this on a large body of music by excluding and including note duration in the definition of the unique alphabet of notes.

연구 동기 및 목표

  • 생물학적으로 진화된 체계(예: 단백질)와 인간이 설계한 체계(예: 소프트웨어 기능) 간에 기원과 과정이 매우 다름에도 불구하고 길이 분포의 놀라운 유사성을 설명하기 위해.
  • 이질적 및 동질적 이산 체계에 모두 적용 가능한 보존된 하틀리-샤논 정보(CoHSI) 기반의 통합 이론적 프레임워크를 수립하기 위해.
  • 관측된 구성 요소 길이 분포의 힘의 법칙적 행동이 우연이 아니라 근본적인 정보 이론 원리의 결과임을 입증하기 위해.
  • 복잡한 체계, 예를 들어 단백질체, 소프트웨어, 음악, 언어, 원소 농도 등에서 재현 가능한 오픈소스 방법을 사용하여 이론을 검증하기 위해.
  • 동일한 체계 내의 서로 다른 알파벳(예: 음악에서 노트 지속시간 포함 또는 제외)이 힘의 법칙으로 관련되어 있음을 보여주기 위해.

제안 방법

  • 기본 통계역학 프레임워크 내에 CoHSI를 통합하여 기호 토큰으로 구성된 이산 체계에서의 구성 요소 길이 분포를 유도하기 위해.
  • 공통 알파벳을 공유하는 이질적 체계와 각 구성 요소가 고유 토큰 세트를 사용하는 동질적 체계를 구분하며, 각각 다른 유형의 분포를 생성함.
  • CoHSI 프레임워크를 적용하여 이질적 체계의 경우 단일 최빈값을 가지며 꼬리가 힘의 법칙을 따르는 분포를 예측하고, 동질적 체계의 경우 지프의 법칙과 일치하는 분포를 예측함.
  • 보조 누적 분포 함수(ccdf)에 선형 회귀를 적용하여 힘의 법칙 행동을 테스트하고, 통계적 유의성을 위해 결정계수 R-squared와 p-값을 보고함.
  • 모든 결과, 표 및 그림를 리눅스 시스템에서 재현 가능한 오픈소스 소프트웨어 패키지를 통해 재현성 검증을 수행함.
  • 노트 지속시간을 포함하거나 제외함으로써 음악의 고유 알파벳을 재정의하여, 동일한 체계 내에서 서로 다른 알파벳 간의 힘의 법칙 관계를 입증함.

실험 결과

연구 질문

  • RQ1기원, 시간 척도, 정확도가 매우 다른 단백질과 컴퓨터 기능의 길이 분포가 거의 동일한 단일 최빈값과 힘의 법칙 꼬리를 가지는 이유는 무엇인가?
  • RQ2단일 정보 이론 원리가 생물학적으로 진화한 체계와 인간이 설계한 이산 체계 간의 유사한 길이 분포의 기원을 설명할 수 있는가?
  • RQ3공통 알파벳을 공유하는 이질적 체계와 각 구성 요소가 고유 토큰 세트를 사용하는 동질적 체계는 길이 분포 패턴에서 어떻게 다를까?
  • RQ4구성 요소 길이 분포의 관측된 힘의 법칙 꼬리가 의미나 기능과 무관하게 근본적인 정보 보존 법칙의 결과인지 어느 정도 반영하는가?
  • RQ5동일한 체계 내에서 서로 다른 알파벳(예: 지속시간 포함 또는 제외된 음악)이 이론에서 예측한 바와 같이 힘의 법칙으로 관련되어 있는가?

주요 결과

  • 8,000만 개의 UniProt 단백질과 8,000만 개의 C 언어 기능의 길이 분포 모두 날카운 단일 최빈값과 힘의 법칙 꼬리를 가지며, 단백질 알파벳 크기 꼬리(21.0–30.0)의 ccdf p-값은 6.576×10⁻¹²이고 결정계수 R-squared는 0.9951이다.
  • 공통 알파벳을 공유하는 이질적 체계는 CoHSI 분포를 생성하며, 날카운 단일 최빈값을 가지며 힘의 법칙으로 점 渐차 수렴하는 반면, 동질적 체계는 지프의 법칙과 일치하는 분포를 생성한다.
  • 이론은 동일한 체계 내 서로 다른 알파벳 간에 반드시 힘의 법칙 관계가 존재해야 한다고 예측하며, 음악에서 지속시간 포함/제외를 비교함으로써 이 이론이 확인되었다.
  • CoHSI 프레임워크는 단백질체, 소프트웨어, 음악, 언어, 원소 농도 등 다양한 체계에서 관측된 분포를 고도의 통계적 유의성로 설명한다.
  • 재현 가능성 패키지(http://leshatton.org/index_RE.html)는 모든 결과, 표, 그림를 완전히 재구성할 수 있도록 하며, 머신 환경 검증 및 회귀 테스팅까지 포함한다.
  • 이론은 토큰에 무관하므로, 토큰의 기능적 또는 의미적 의미가 아니라 선택의 수(알파벳 크기)에만 의존한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.