[논문 리뷰] Redundancies in Large-scale Protein Interaction Networks
이 논문은 무작위 확률에 비해 유의미하게 더 많은 공통 상호작용 파트너를 공유하는 단백질 쌍을 탐지함으로써 대규모 단백질-단백질 상호작용 네트워크에서 생물학적으로 의미 있는 기능적 연관성을 식별하는 통계적 방법을 제안한다. 이 방법은 *S. cerevisiae*에서 2,833개의 고신뢰도 기능적 연관성을 식별하여, 이중합성 데이터의 높은 가짜 양성률이 존재하는 상황에서도 정확도가 매우 높은 81개의 미암호화된 단백질의 기능을 신뢰할 수 있게 예측한다.
Understanding functional associations among genes discovered in sequencing projects is a key issue in post-genomic biology. However, reliable interpretation of the protein interaction data has been difficult. In this work, we show that if two proteins share significantly larger number of common interaction partners than random, they have close functional associations. Analysis of publicly available data from Saccharomyces cerevisiae reveals more than 2800 reliable functional associations, 29% of which involve at least one unannotated protein. By further analyzing these associations, we derive tentative functions for 81 unannotated proteins with high certainty.
연구 동기 및 목표
- 후게놈 생물학에서 노이즈가 많고 고속의 단백질 상호작용 데이터를 해석하는 데 도전하는 것.
- 공통 상호작용 파트너의 통계적 유의성으로 단백질 간 신뢰할 수 있는 기능적 연관성을 식별하는 것.
- *Saccharomyces cerevisiae*에서 네트워크 기반 추론을 사용하여 미암호화된 단백질의 기능을 예측하는 것.
- 가짜 양성률에 강건하고 단백질 연결성의 정도 편향에 민감하지 않은 방법을 개발하는 것.
- 대규모 상호작용 네트워크에서 기능 모듈을 드러내고 새로운 단백질 복합체를 발견하는 것.
제안 방법
- 측정된 네트워크에서 단백질 쌍 간의 공통 상호작용 파트너 수를 동일한 크기와 파워-법 연결성 특성을 가진 랜덤화된 네트워크와 비교한다.
- 특정 수의 공통 파트너가 무작위로 발생할 확률을 계산하기 위해 통계적 검정을 사용하며, 이 확률에 따라 모든 단백질 쌍을 순위 매긴다.
- 무작위 공존 가능성 확률이 매우 낮은 단백질 쌍을 선택하기 위해 임계값 10⁻⁸를 적용하여 강력한 기능적 연관성을 나타내는 쌍을 선별한다.
- 기능적으로 관련된 단백질이 조밀한 하위네트워크를 형성한다는 가정을 바탕으로, 고유의 유의성 단백질 쌍을 군집화하여 기능 모듈을 구성한다.
- SGD 데이터베이스에 저장된 알려진 기능 복합체와의 비교를 통해 예측 결과를 검증한다.
- 사용자가 다양한 유의성 임계값에서 연관성과 모듈을 탐색할 수 있도록 상호작용 웹 도구를 제공한다.
실험 결과
연구 질문
- RQ1공통 상호작용 파트너 수가 비정상적으로 높은 단백질 쌍은 신뢰할 수 있는 기능적 연관성을 추론하는 데 사용될 수 있는가?
- RQ2이중합성 데이터의 높은 가짜 양성률에도 불구하고 이 방법이 기존의 알려진 기능 모듈을 어느 정도 회복할 수 있는가?
- RQ3이 접근법은 미암호화된 단백질의 기능을 높은 확신으로 예측할 수 있는가?
- RQ4이 방법은 무작위 노이즈와 스케일프리 네트워크 구조의 오류 요소에 대해 얼마나 강건한가?
- RQ5이 방법은 새로운, 특성화되지 않은 단백질 복합체나 경로를 드러낼 수 있는가?
주요 결과
- 이 방법은 *S. cerevisiae*에서 852개 단백질에 관여하는 2,833개의 고신뢰도 기능적 연관성을 식별하였으며, 이 중 29%의 쌍은 적어도 한 개의 미암호화된 단백질을 포함하고 있었다.
- 데이터셋에 50%의 무작위 상호작용을 추가한 후에도 원래의 고유의 유의성 연관성의 약 90%를 회복하여, 가짜 양성률에 대한 강건성을 입증하였다.
- 2,833개의 연관성 중 상위 100개 쌍의 95%는 유사한 기능을 가진 단백질을 포함하고 있어, 이 방법의 생물학적 관련성을 검증하였다.
- 이 연관성에서 유도된 기능 모듈은 163개 중 149개(약 92%)가 모두 동일한 기능 복합체 또는 경로에 암호화된 단백질로 구성되어 있음을 보여주었다.
- 이 방법은 81개의 미암호화된 단백질의 기능을 높은 확신으로 예측하였으며, 이 중 22개의 예측은 SGD 데이터베이스에 의해 나중에 확인되었다.
- 두 개의 새로운 모듈이 식별되었으며, 이는 액틴 세 cytoskeleton 정렬 및 rRNA 처리와 관련이 있을 가능성이 있어, 실험적 검증을 위한 새로운 생물학적 복합체를 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.