Skip to main content
QUICK REVIEW

[논문 리뷰] Learning modular structures from network data and node variables

Elham Azizi, James E. Galagan|arXiv (Cornell University)|2014. 05. 11.
Gene Regulatory Network Analysis참고 문헌 34인용 수 9
한 줄 요약

이 논문은 단백질-DNA 상호작용, 사회적 팔로잉과 같은 네트워크 데이터와 유전자 발현, 사용자 활동과 같은 노드 기반 변수를 통합하여 복잡한 시스템 내에서 모듈형 의존 구조를 학습하는 새로운 확률 모델을 제안한다. 스토하스틱 블록모델과 모듈 네트워크를 조합하고 역전이-점프 MCMC를 사용한 추론을 통해 정체성 확보를 향상시키고, 거짓 양성률을 감소시키며, 합성 데이터, 미세박테리아 투버큘로시스 유전자 네트워크, 트위터 소셜 네트워크에서 규제 및 영향 구조를 정확하게 복원한다.

ABSTRACT

A standard technique for understanding underlying dependency structures among a set of variables posits a shared conditional probability distribution for the variables measured on individuals within a group. This approach is often referred to as module networks, where individuals are represented by nodes in a network, groups are termed modules, and the focus is on estimating the network structure among modules. However, estimation solely from node-specific variables can lead to spurious dependencies, and unverifiable structural assumptions are often used for regularization. Here, we propose an extended model that leverages direct observations about the network in addition to node-specific variables. By integrating complementary data types, we avoid the need for structural assumptions. We illustrate theoretical and practical significance of the model and develop a reversible-jump MCMC learning procedure for learning modules and model parameters. We demonstrate the method accuracy in predicting modular structures from synthetic data and capability to learn influence structures in twitter data and regulatory modules in the Mycobacterium tuberculosis gene regulatory network.

연구 동기 및 목표

  • 노드 변수만으로 모듈 네트워크를 추론할 경우 발생하는 높은 거짓 양성률 문제를 해결하기 위해, 관측되지 않은 혼란 요인과 검증 불가능한 구조적 가정으로 인한 문제를 해결한다.
  • 노드 수준의 측정치와 보완적인 네트워크 데이터(예: ChIP-Seq, 사회적 팔로잉 관계)를 통합하여 의존 구조 학습에서 모델의 과소정의 및 정체성 불확보 문제를 해결한다.
  • 물리적 또는 관측된 네트워크 상호작용을 잠재적 의존성의 제약 조건으로 활용하여 임의의 정규화를 피하는 확장 가능하고 통계적으로 안정된 방법을 개발한다.
  • 실제 생물학적 및 사회적 네트워크에서 조건별 규제 프로그램과 영향력 있는 커뮤니티를 탐색할 수 있도록 한다.
  • 모듈당 조합 프로그램을 통해 전반적인 의존 구조와 조건별 규제 효과를 동시에 모델링하는 통합 프레임워크를 제공한다.

제안 방법

  • 노드가 잠재 모듈에 할당되고 의존성이 공통 조건부 분포에 의해 결정되는, 모듈 네트워크와 스토하스틱 블록모델을 조합한 공동 확률 모델을 제안한다.
  • ChIP-Seq에서 유도된 방향성 간선 또는 팔로잉 관계와 같은 네트워크 데이터를 사용하여 블록 구조를 정의하고 가능한 부모 모듈의 공간을 제한함으로써 계산의 타당성을 향상시킨다.
  • 두 가지 유형의 규제 효과를 통합한다: 공통 부모 구조에 기인한 작은 전반적 이동과, 부모 활동에 기반한 큰 조건별 효과로, 조합 프로그램을 통해 모델링한다.
  • 역전이-점프 마르코프 체인 몬테카를로(RJ-MCMC) 알고리즘을 사용하여 모듈 할당, 부모 구조, 모델 파라미터를 동시에 추론함으로써 모델 공간 탐색이 가능해진다.
  • 매개변수 추정을 위해 지그비 샘플링을 사용하여 가능도의 다중 최적화 문제에 대한 강건성을 향상시켜 결정론적 최적화 방법보다 우수하다.
  • 유전자 발현, 단백질-DNA 상호작용, 사용자 활동, 소셜 그래프와 같은 다양한 출처의 데이터를 하나의 통합 추론 프레임워크에 통합한다.

실험 결과

연구 질문

  • RQ1노드 기반 변수 외에 네트워크 상호작용 데이터를 통합할 경우, 노드 변수만을 사용할 때보다 모듈형 의존 구조의 정체성 확보 능력과 정확도가 향상되는가?
  • RQ2물리적 또는 관측된 네트워크 상호작용을 포함시킴으로써 모듈 네트워크 추론에서 거짓 양성 의존성은 어떻게 감소하는가?
  • RQ3제안된 모델이 유전자 조절 네트워크에서 알려진 생물학적 메커니즘, 예를 들어 피드포워드 루프를 얼마나 잘 복원할 수 있는가?
  • RQ4활동 패tern과 팔로잉 관계만을 사용하여 소셜 네트워크에서 해석 가능한 영향력 있는 커뮤니티와 핵심 영향자들을 탐지할 수 있는가?
  • RQ5실제 생물학적 및 소셜 네트워크에서 링크 예측 평가 시, 표준 모듈 네트워크와 비교해 모델 성능은 어떻게 되는가?

주요 결과

  • 미세박테리아 투버큘로시스 유전자 네트워크에서 DosR 조절자에 대한 링크 예측에서 제안된 통합 모델은 75.4% 정밀도와 93.4% 재현율을 기록했으며, 노드 변수만을 사용한 모듈 네트워크(40.1% 정밀도, 76.3% 재현율)보다 유의미하게 뛰어난 성능을 보였다.
  • KstR 조절자에 대해서는 통합 모델이 83.6% 정밀도와 95.6% 재현율을 달성했고, 모듈 네트워크만 사용했을 경우는 35.8% 정밀도와 67.4% 재현율이었다.
  • 트위터 데이터 분석에서 메시지 M13은 Brian Solis와 같은 저자들에 의해 영향을 받고, M16는 Tantek Celik 같은 기술 전문가들에 의해 영향을 받는 공동체를 성공적으로 식별했으며, Hashtag 패tern이 2009년 주요 사건들과 일치했다.
  • 모델은 미세박테리아 투버큘로시스에서 피드포워드 루프와 지질 대사 및 저산소 적응에서 조건별 조절을 포함한 생물학적으로 의미 있는 규제 프로그램을 드러냈다.
  • 네트워크 데이터의 사용은 모델의 정체성 확보를 가능하게 했고, 노드 변수만으로는 혼란 요인과 과적합으로 인해 정체성이 불확실한 구조로 이어졌다.
  • 역전이-점프 MCMC는 복잡한 모델 공간을 효과적으로 탐색했으며, 고정된 구조적 가정에 의존하지 않고도 모듈 구조, 부모 집합, 매개변수를 동시에 추론할 수 있도록 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.