Skip to main content
QUICK REVIEW

[논문 리뷰] CoHSI I; Detailed properties of the Canonical Distribution for Discrete Systems such as the Proteome

Les Hatton, Gregory W. Warr|arXiv (Cornell University)|2018. 06. 21.
Statistical Mechanics and Entropy참고 문헌 13인용 수 6
한 줄 요약

이 논문은 단백질체, 소프트웨어, 텍스트와 같은 이산 시스템을 위한 기본 통계 모델로 보존된 하틀리-샤논 정보(CoHSI) 분포를 도입한다. 통계역학 프레임워크 내에서 정보이론적 제약 조건을 적용함으로써, 자연스럽게 구배가 있는 파wr-법 꼬리와 단일 최고점이 나타나는 분포를 유도한다. 이는 국소적 메커니즘(예: 자연선택 또는 인간 설계) 없이도 평균 성분 길이의 보존과 긴 성분의 빈도 높은 발생을 설명한다.

ABSTRACT

The CoHSI (Conservation of Hartley-Shannon Information) distribution is at the heart of a wide-class of discrete systems, defining the length distribution of their components amongst other global properties. Discrete systems such as the known proteome where components are proteins, computer software, where components are functions and texts where components are books, are all known to fit this distribution accurately. In this short paper, we explore its solution and its resulting properties and lay the foundation for a series of papers which will demonstrate amongst other things, why the average length of components is so highly conserved and why long components occur so frequently in these systems. These properties are not amenable to local arguments such as natural selection in the case of the proteome or human volition in the case of computer software, and indeed turn out to be inevitable global properties of discrete systems devolving directly from CoHSI and shared by all. We will illustrate this using examples from the Uniprot protein database as a prelude to subsequent studies.

연구 동기 및 목표

  • 이산 시스템(예: 단백질체, 소프트웨어, 텍스트)에 대한 일반적인 모델로 CoHSI 분포를 수립하기 위해.
  • 다른 진화나 설계 역사를 가진 다양한 시스템들 사이에서 평균 성분 길이가 왜 높이 보존되는지 설명하기 위해.
  • 긴 성분이 자연선택이나 설계와 같은 국소적 메커니즘이 없이도 CoHSI 분포의 전반적 성질에 의해 필수적으로 발생하는 이유를 보여주기 위해.
  • CoHSI 방정식을 사용한 성분 길이 분포의 재현 가능한 분석을 위한 계산 프레임워크를 제공하기 위해.
  • 이 정보이론적 접근법을 사용해 단백질체를 상세히 분석하는 후속 논문을 위한 이론적 기반을 마련하기 위해.

제안 방법

  • 모든 미세상태가 동일하게 확률이 주어지는 통계역학 모델을 설정하고, 전역 제약 조건으로 하트리-샤논 정보 보존(CoHSI)을 적용한다.
  • CoHSI 방정식을 사용해 성분 길이 분포의 암시적 해를 유도한다: $ \log t_i + \frac{1+8t_i+24t_i^2}{6(t_i+4t_i^2+8t_i^3)} = -\alpha - \beta \left( \frac{d}{dt_i} \log N(t_i, a_i; a_i) \right) $, 여기서 $ N $ 은 알파벳 크기 $ a_i $ 로부터 $ t_i $ 개의 토큰을 순서 있게 배열하는 경우의 수를 세는 함수이다.
  • 작은 $ t_i $ 에서의 정확도를 향상시키기 위해 라만두잔의 근사법을 사용해 $ \log t_i! $ 를 근사한다.
  • 파arameter 공간 $ \alpha, \beta $ 에서 평균, 중앙값, 최빈값의 3D 시각화 플롯을 분석하여, 분포의 거동을 이해한다.
  • 모델이 $ \alpha $ 는 정규화를 제어하고 $ \beta $ 는 큰 성분에 대해 구배가 있는 파워-법 기울기를 제어하며, 둘 다 작은 성분에 대한 최고점의 형태를 함께 결정함을 보여준다.
  • 모델의 척도 불변성과 점 渐진적으로 파워-법 분포에 수렴할 수 있음을 검증한다.

실험 결과

연구 질문

  • RQ1다른 국소적 메커니즘(예: 진화나 설계)을 가진 단백질체나 소프트웨어와 같은 다양한 이산 시스템들 사이에서 평균 성분 길이가 왜 높이 보존되는가?
  • RQ2지수 분포 하에서는 희귀한데도 단백질체와 같은 시스템에서 긴 성분이 자주 발생하는 이유는 무엇인가?
  • RQ3CoHSI 방정식의 매개변수 $ \alpha $ 와 $ \beta $ 가 분포의 최고점과 꼬리 행동을 함께 어떻게 형성하는가?
  • RQ4실제 시스템(예: TrEMBL)에서 관측된 길이 분포가 자연선택이나 설계를 고려하지 않은 최소한의 정보이론적 모델로 어느 정도 설명될 수 있는가?
  • RQ5왜 분포의 최빈값은 매개변수 변화에 대해 평균과 중앙값과는 다르게 행동하는가?

주요 결과

  • CoHSI 방정식은 단백질체, 소프트웨어, 텍스트와 같은 이산 시스템의 길이 분포를 높은 정확도로 모델링한다.
  • 분포는 큰 성분에 대해 점 渐진적으로 파워-법에 수렴하며, TrEMBL와 같은 시스템의 실증 관측 결과와 일치한다.
  • 매개변수 $ \beta $ 는 보완 누적 분포함수(ccdf)의 파워-법 기울기를 제어하며, TrEMBL에서 일반적인 값은 $ \beta \sim 0.1 $ 정도이다.
  • 매개변수 $ \alpha $ 는 정규화를 제어하며, 작은 $ \beta $ 에서는 평균과 중앙값에 거의 영향을 주지 않아, 큰 성분 크기에서는 분리됨을 나타낸다.
  • 최빈값은 $ \alpha $ 가 증가할수록 증가하고 $ \beta $ 가 증가할수록 감소하며, 평균과 중앙값과는 반대로 행동한다. 반면 평균과 중앙값은 둘 다 $ \alpha $ 와 $ \beta $ 가 증가할수록 증가한다.
  • CoHSI 분포는 척도 불변성을 가지며, 총 성분 수 $ T $ 에 대한 명시적 의존성이 없어, 크기가 다른 시스템 전반에서의 일반성에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.