Skip to main content
QUICK REVIEW

[論文レビュー] Information Theory and the Length Distribution of all Discrete Systems

Les Hatton, Gregory W. Warr|arXiv (Cornell University)|Sep 6, 2017
Statistical Mechanics and Entropy参考文献 41被引用数 6
ひとこと要約

本稿では、保存則としてのハートリー=シャノン情報量(CoHSI)が、タンパク質、ソフトウェア関数、音楽的構成など多様な離散的システムで観察される普遍的なべき乗則的長さ分布を説明すると提案している。異種のシステム(共有アスキューを持つ)は一峰性でべき乗則的尾を示す分布を生じるが、同種のシステム(各コンポーネントが固有のトークン集合を使用する)はジプフの法則に従う。この理論は生物学的、ソフトウェア的、音楽的データセットにおいて高い統計的有意性で検証された。

ABSTRACT

We begin with the extraordinary observation that the length distribution of 80 million proteins in UniProt, the Universal Protein Resource, measured in amino acids, is qualitatively identical to the length distribution of large collections of computer functions measured in programming language tokens, at all scales. That two such disparate discrete systems share important structural properties suggests that yet other apparently unrelated discrete systems might share the same properties, and certainly invites an explanation. We demonstrate that this is inevitable for all discrete systems of components built from tokens or symbols. Departing from existing work by embedding the Conservation of Hartley-Shannon information (CoHSI) in a classical statistical mechanics framework, we identify two kinds of discrete system, heterogeneous and homogeneous. Heterogeneous systems contain components built from a unique alphabet of tokens and yield an implicit CoHSI distribution with a sharp unimodal peak asymptoting to a power-law. Homogeneous systems contain components each built from just one kind of token unique to that component and yield a CoHSI distribution corresponding to Zipf's law. This theory is applied to heterogeneous systems, (proteome, computer software, music); homogeneous systems (language texts, abundance of the elements); and to systems in which both heterogeneous and homogeneous behaviour co-exist (word frequencies and word length frequencies in language texts). In each case, the predictions of the theory are tested and supported to high levels of statistical significance. We also show that in the same heterogeneous system, different but consistent alphabets must be related by a power-law. We demonstrate this on a large body of music by excluding and including note duration in the definition of the unique alphabet of notes.

研究の動機と目的

  • 生物学的に進化したシステム(例:タンパク質)と人間が設計したシステム(例:ソフトウェア関数)の間で、起源やプロセスが著しく異なるにもかかわらず、長さ分布の類似性を説明すること。
  • 異種および同種の離散的システムに適用可能な、保存則としてのハートリー=シャノン情報量(CoHSI)に基づく統一的理論枠組みを確立すること。
  • 観察されたコンポーネント長さ分布におけるべき乗則的挙動が偶然ではなく、根本的な情報理論的原則の結果であることを示すこと。
  • 再現可能でオープンソースの手法を用いて、プロテオーム、ソフトウェア、音楽、言語、元素の存在度など多様なシステムにおいて理論を検証すること。
  • 同じシステム内における異なるアスキュー(例:音楽におけるノートディレイの有無)がべき乗則によって関係していることを示すこと。

提案手法

  • 古典的統計力学の枠組みにCoHSIを埋め込み、記号的トークンから構成される離散的システムにおけるコンポーネント長さの分布を導出する。
  • 共通のアスキューを共有する異種システム(コンポーネント間でアスキューが共有される)と、各コンポーネントが固有のトークン集合を使用する同種システム(各コンポーネントが固有のトークン集合を持つ)を区別し、それぞれ異なる分布型を生じることを示す。
  • CoHSIフレームワークを用いて、異種システムでは一峰性でべき乗則的尾を示す分布を予測し、同種システムではジプフの法則に一致する分布を予測する。
  • 補完的累積分布関数(ccdf)に対する線形回帰を用いてべき乗則的挙動をテストし、統計的有意性を示すための決定係数(R-squared)とp値を報告する。
  • Linuxシステム上で動作するオープンソースのソフトウェアパッケージを用いて、すべての結果、表、図の再現性を確認する。
  • ノートディレイを含めるまたは除外することで、音楽における固有のアスキューを再定義し、同じシステム内での異なるアスキュー間のべき乗則的関係を実証する。

実験結果

リサーチクエスチョン

  • RQ1タンパク質とコンピュータ関数の長さ分布が、起源、時間スケール、正確性が著しく異なるにもかかわらず、ほぼ同一の単峰性でべき乗則的尾を示すのはなぜか?
  • RQ2一つの情報理論的原則が、生物学的に進化したシステムと人間が設計した離散的システムの両方で、類似した長さ分布の出現を説明できるか?
  • RQ3共通のアスキューを持つ異種システムと、各コンポーネントが固有のトークン集合を持つ同種システムは、それぞれの長さ分布のパターンでどのように異なるか?
  • RQ4コンポーネント長さ分布の観察されたべき乗則的尾は、意味や機能とは独立した、情報の根本的保存則の反映であるとどの程度言えるか?
  • RQ5同じシステム内における異なるアスキュー(例:ノートディレイを含む・含まない音楽)は、理論が予測するようにべき乗則によって関係しているか?

主な発見

  • UniProtタンパク質8000万個とC言語関数8000万個の両方の長さ分布が、鋭い単峰性ピークとべき乗則的尾を示し、タンパク質のアスキュー・サイズの尾(21.0–30.0)においてccdfのp値は6.576×10⁻¹²、決定係数は0.9951であった。
  • 共通のアスキューを持つ異種システムは、CoHSI分布を生じさせ、鋭い単峰性ピークとべき乗則的尾を示すが、同種システムはジプフの法則に一致する分布を生じる。
  • 理論は、同じシステム内における異なるアスキューがべき乗則によって関係していると予測しており、ノートディレイの有無を比較することで音楽においてこの予測が確認された。
  • CoHSIフレームワークは、プロテオーム、ソフトウェア、音楽、言語、元素の存在度など多様なシステムにおける観察された分布を、高い統計的有意性で説明できる。
  • 再現性パッケージは http://leshatton.org/index_RE.html で公開されており、すべての結果、表、図の完全な再構築が可能であり、マシン環境の確認と回帰テストも含まれる。
  • 理論はトークンに依存しない(token-agnostic)ため、トークンの機能的・意味的意味とは無関係に、利用可能な選択肢の数(アスキューのサイズ)のみに依存する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。