Skip to main content
QUICK REVIEW

[論文レビュー] Set-based complexity and biological information

David J. Galas, Matti Nykter|ArXiv.org|Jan 25, 2008
Computability, Logic, AI Algorithms参考文献 39被引用数 8
ひとこと要約

本稿は、ランダムネスと再帰性を除外することで生物学的に意味のある情報を定量化するため、コルモゴロフ複雑度に基づく集合ベースの複雑度測度を導入する。普遍的情報距離に基づく測度を形式化し、事前に定義された状態空間を必要とせずに文脈情報を内蔵的に捉える。最大化により、ゲノムおよびレギュラトリー配列における生物学的に関連性のある複雑度パターンが得られる。

ABSTRACT

It is not obvious what fraction of all the potential information residing in the molecules and structures of living systems is significant or meaningful to the system. Sets of random sequences or identically repeated sequences, for example, would be expected to contribute little or no useful information to a cell. This issue of quantitation of information is important since the ebb and flow of biologically significant information is essential to our quantitative understanding of biological function and evolution. Motivated specifically by these problems of biological information, we propose here a class of measures to quantify the contextual nature of the information in sets of objects, based on Kolmogorov's intrinsic complexity. Such measures discount both random and redundant information and are inherent in that they do not require a defined state space to quantify the information. The maximization of this new measure, which can be formulated in terms of the universal information distance, appears to have several useful and interesting properties, some of which we illustrate with examples.

研究の動機と目的

  • 分子系における生物学的に有意な情報の定量化の挑戦に応えること。ここでは、ランダムまたは繰り返しの配列は機能的価値が低いため。
  • 外部から定義された状態空間に依存せずに、文脈情報を内蔵的に考慮する複雑度測度を開発すること。
  • 配列や構造の集合において、ノイズや再帰性から意味のある生物学的情報を区別する測度を形式化すること。
  • 生物学的機能および進化の文脈において、この測度の性質を調査すること。特にゲノムおよびレギュラトリーネットワークにおいて。

提案手法

  • 個々の要素ではなく、集合全体のアルゴリズム的複雑度に注目することで、コルモゴロフの内在的複雑度を集合のオブジェクトに適応する。
  • 普遍的情報距離を基盤として、構造的および文脈的関係を捉える集合ベースの複雑度測度を定義する。
  • ランダムな配列および同一の繰り返しを内蔵的に除外する測度を設計する。これらは意味のある情報を寄与しない。
  • ゲノム配列やレギュラトリーモチーフなどの生物学的データセットに測度を適用し、文脈に配慮した形で複雑度を評価する。
  • 複雑度測度を最大化して、情報含量が高く機能的関連性の高い構成を特定する。
  • 情報理論的原則を用いて、測度が特定の変換に対して不変であり、ノイズに対して頑健であることを保証する。

実験結果

リサーチクエスチョン

  • RQ1分子系において、ランダムまたは再帰的配列から生物学的に意味のある情報をどのように区別できるか?
  • RQ2文脈的関係を考慮するが、事前に定義された状態空間を必要としない生物学的オブジェクトの集合に対する適切な複雑度測度は何か?
  • RQ3提案された集合ベースの複雑度測度は、既知の生物学的機能および進化的ダイナミクスとどのように関係するか?
  • RQ4普遍的情報距離から導かれる複雑度測度の数学的および計算的性質は、生物学的文脈においてどのようなものか?
  • RQ5この複雑度測度の最大化は、ゲノムおよびレギュラトリーモチーフにおける生物学的に有意なパターンを明らかにできるか?

主な発見

  • 提案された集合ベースの複雑度測度は、ランダムおよび再帰的配列を効果的にフィルタリングし、構造的および文脈的に意味のある情報に集中する。
  • 測度は内蔵的に定義されており、事前に状態空間を指定する必要がなく、多様な生物学的データタイプに適している。
  • 複雑度測度の最大化により、機能的関連性の高い構成が明らかになり、生物学的調節および進化と関連する可能性が示唆される。
  • ノイズが存在する状況でも、ゲノム配列およびレギュラトリーネットワークにおいて意味のあるパターンを同定するという点で、測度は頑健である。
  • 理論的分析により、測度は既知のアルゴリズム的情報理論の原則と整合しており、生物学的情報の定量化に原理的フレームワークを提供する。
  • 実証例により、従来のエントロピーまたは情報測度よりも、生物学的システムの機能的複雑度をよりよく捉えられることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。