Skip to main content
QUICK REVIEW

[논문 리뷰] Comment on Yu et al., "High Quality Binary Protein Interaction Map of the Yeast Interactome Network." Science 322, 104 (2008)

Aaron Clauset|ArXiv.org|2009. 01. 05.
Bioinformatics and Genomic Networks참고 문헌 15인용 수 7
한 줄 요약

이 논문은 유전자 상호작용 네트워크의 도수 분포가 거듭제곱 법칙을 따른다는 유 등(2004)의 주장에 도전하며, 엄밀한 통계 분석을 통해 유전자 상호작용 네트워크의 상위 10.3%에 해당하는 높은 연결성을 가진 노드들(도수 ≥6)만이 거듭제곱 법칙을 타당하게 따르며, 규모의 법칙 상수는 α = 2.9 ± 0.2임을 입증한다. 본 연구는 유 등(2004)의 선형 회귀 분석 방식이 편향된 결과를 초래했음을 보이며, 전체 네트워크는 단순한 거듭제곱 법칙 모델로 기술할 수 없는 정도로 뚜렷한 구조적 복잡성을 보임을 시사한다.

ABSTRACT

We test the claim by Yu et al. -- presented in Science 322, 104 (2008) -- that the degree distribution of the yeast (Saccharomyces cerevisiae) protein-interaction network is best approximated by a power law. Yu et al. consider three versions of this network. In all three cases, however, we find the most likely power-law model of the data is distinct from and incompatible with the one given by Yu et al. Only one network admits good statistical support for any power law, and in that case, the power law explains only the distribution of the upper 10% of node degrees. These results imply that there is considerably more structure present in the yeast interactome than suggested by Yu et al., and that these networks should probably not be called "scale free."

연구 동기 및 목표

  • 유 등(2004)의 주장, 즉 유전자 상호작용 네트워크의 도수 분포가 거듭제곱 법칙을 따른다는 것을 비판적으로 평가하기 위해.
  • 특히 로그 변환된 데이터에 대한 선형 회귀 분석을 사용한 유 등(2004)의 방법의 통계적 타당성을 평가하기 위해.
  • 유전자 상호작용 네트워크 전체의 도수 분포가 거듭제곱 법칙으로 가장 잘 기술되는지, 아니면 구조적 복잡성이 지배적인지 판단하기 위해.
  • 세 가지 버전의 유전자 상호작용 네트워크인 Y2H-union, Combined-AP/MS, LC-multiple에 대해 거듭제곱 법칙 피팅의 통계적 지지를 비교하기 위해.
  • 실험적 증거와 적절한 통계 모델링 기반으로 네트워크가 정확히 '척도 불변성'으로 간주될 수 있는지 명확히 하기 위해.

제안 방법

  • 거듭제곱 법칙 피팅을 위해 최대우도추정법을 사용하여 Y2H-union, Combined-AP/MS, LC-multiple 유전자 상호작용 네트워크를 재분석하였다.
  • 거듭제곱 법칙 피팅의 통계적 유의성을 평가하기 위해 콜모고로프-스미르노프 검정을 적용하였으며, 보완적 누적분포함수(CCDF)를 사용하였다.
  • 클로우스 등(2007)의 방법을 사용하여 거듭제곱 법칙이 성립할 수 있는 최소 도수 x_min를 추정하였으며, 피팅의 적합도가 최대가 되는 값을 선택하였다.
  • 유의성 수준을 평가하기 위해 콜모고로프-스미르노프 검정의 p-값을 사용하였으며, p > 0.1은 거듭제곱 법칙에 대한 타당한 지지를 의미한다.
  • 세 네트워크의 최적 피팅 거듭제곱 법칙의 규모의 법칙 상수(α)를 비교하여 일관성을 평가하였다.
  • 유 등(2004)의 거듭제곱 법칙 대비 지수 감쇠가 포함된 거듭제곱 법칙 모델 비교 접근법을 재평가하였으며, 이 방법이 통계적으로 신뢰할 수 없다는 점을 지적하였다.

실험 결과

연구 질문

  • RQ1유전자 상호작용 네트워크의 도수 분포가 실제로 유 등(2004)의 주장처럼 거듭제곱 법칙으로 가장 잘 기술되는가?
  • RQ2로그 변환된 데이터에 대한 선형 회귀 분석이 단백질 상호작용 네트워크에서 거듭제곱 법칙 상수의 편향되거나 잘못된 추정을 초래하는가?
  • RQ3유전자 상호작용 네트워크의 노드 중 어느 비율이 도수 분포가 거듭제곱 법칙을 따르며, 이 분포는 다양한 네트워크 버전 간 일관성이 있는가?
  • RQ4Y2H-union 및 LC-multiple 네트워크의 거듭제곱 법칙 피팅에 대한 규모의 법칙 상수는 통계적으로 호환되는가, 아니면 네트워크 구조의 근본적인 차이를 시사하는가?
  • RQ5x_min = 6에서 관찰된 전이점은 네트워크 조직의 맥락에서 '고도수 노드'를 정의하는 의미 있는 임계값으로 해석될 수 있는가?

주요 결과

  • 최대우도 추정을 통해 유도된 Y2H-union 네트워크의 가장 가능성 있는 거듭제곱 법칙 모델은 규모의 법칙 상수 α = 2.9 ± 0.2를 가지며, 이는 유 등(2004)이 보고한 α = 2.4와 상충된다.
  • Y2H-union 네트워크에서 상위 10.3%의 노드(도수 ≥6인 209개 노드)만이 통계적으로 타당한 거듭제곱 법칙 행동을 보이며(p = 0.95 ± 0.03), 나머지 분포는 그렇지 않다.
  • Combined-AP/MS 네트워크는 거듭제곱 법칙 피팅에 대한 통계적 지지를 보이지 않으며(p = 0.01 ± 0.03), 이는 도수 분포가 거듭제곱 법칙으로 잘 기술되지 않음을 시사한다.
  • LC-multiple 네트워크는 상위 범위에서만 약간의 지지를 보이며(p = 0.15 ± 0.03), 규모의 법칙 상수는 α = 3.3 ± 0.2이며, Y2H-union의 추정치와 유의미하게 다름.
  • Y2H-union 및 LC-multiple 네트워크의 최적 피팅 거듭제곱 법칙 모델은 상호 간에 크게 불일치하며, 이는 표본 변동성으로 설명할 수 없는 구조적 차이를 시사한다.
  • x_min = 6에서 도수 분포가 비거듭제곱 법칙에서 거듭제곱 법칙으로 전이되는 전이점의 존재는, 단일 거듭제곱 법칙 모델로는 기술할 수 없는 다중 구조적 영역을 포함하고 있음을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.