Skip to main content
QUICK REVIEW

[논문 리뷰] Flexible model selection for mechanistic network models

Sixing Chen, Antonietta Mira|arXiv (Cornell University)|2018. 04. 01.
Markov Chains and Monte Carlo Methods참고 문헌 45인용 수 4
한 줄 요약

이 논문은 유전자 상호작용 네트워크의 메커니즘적 네트워크 모델에 대해 가능도 기반 모델 선택 프레임워크를 제안한다. 시뮬레이터 기반 추론과 슈퍼러너(Super Learner)를 활용하여 네트워크 요약 통계량을 기반으로 경쟁 모델을 선택한다. 근사 베이지안 계산(ABC)과 앙상블 학습을 조합함으로써 가능도가 계산이 어려운 경우에도 강건하고 불확실성 측정이 가능한 모델 선택이 가능해지며, 효모 단백질-단백질 상호작용 네트워크에서 뛰어난 성능을 보였다.

ABSTRACT

Network models are applied across many domains where data can be represented as a network. Two prominent paradigms for modeling networks are statistical models (probabilistic models for the observed network) and mechanistic models (models for network growth and/or evolution). Mechanistic models are better suited for incorporating domain knowledge, to study effects of interventions (such as changes to specific mechanisms) and to forward simulate, but they typically have intractable likelihoods. As such, and in a stark contrast to statistical models, there is a relative dearth of research on model selection for such models despite the otherwise large body of extant work. In this paper, we propose a simulator-based procedure for mechanistic network model selection that borrows aspects from Approximate Bayesian Computation (ABC) along with a means to quantify the uncertainty in the selected model. To select the most suitable network model, we consider and assess the performance of several learning algorithms, most notably the so-called Super Learner, which makes our framework less sensitive to the choice of a particular learning algorithm. Our approach takes advantage of the ease to forward simulate from mechanistic network models to circumvent their intractable likelihoods. The overall process is flexible and widely applicable. Our simulation results demonstrate the approach's ability to accurately discriminate between competing mechanistic models. Finally, we showcase our approach with a protein-protein interaction network model from the literature for yeast (Saccharomyces cerevisiae).

연구 동기 및 목표

  • 가능도가 계산이 어려운 메커니즘적 네트워크 모델에 대해 모델 선택 방법의 부족을 해결하기 위해.
  • 가능도가 계산이 어려운 문제를 해결하기 위해 정방향 시뮬레이션을 활용하는 융통성 있는 시뮬레이터 기반 접근법을 개발하기 위해.
  • 앙상블 학습과 ABC 원리를 활용하여 모델 선택의 불확실성 측정을 통합하기 위해.
  • 개별 학습 알고리즘의 선택에 민감도를 줄이기 위해 슈퍼러너 프레임워크를 활용하기 위해.
  • 실제 생물학적 네트워크—효모 단백질-단백질 상호작용 데이터—에 대한 방법의 효과성을 입증하기 위해.

제안 방법

  • 후보 메커니즘적 네트워크 모델에서 정방향 시뮬레이션을 사용하여 시뮬레이션된 네트워크 데이터를 생성한다.
  • 슈퍼러너 알고리즘을 적용하여 요약 통계량을 기반으로 네트워크를 분류하고, 관측된 네트워크를 가장 잘 예측하는 모델을 선택한다.
  • 도메인 지식을 활용하여 후보 모델 간의 차이를 반영하는 요약 통계량을 선정한다.
  • 모델 校정은 시뮬레이션된 네트워크와 관측된 네트워크 간의 핵심 네트워크 특성(예: 차수 분포, 군집 계수)을 일치시켜 수행한다.
  • 분석적 가능도 계산이 필요 없도록, 기계학습을 통해 시뮬레이션된 데이터에서 최적의 분류 특징을 학습함으로써 충분통계량에 의존하지 않는다.
  • 슈퍼러너의 앙상블 예측 성능과 교차검증을 통해 모델 선택의 불확실성을 측정한다.

실험 결과

연구 질문

  • RQ1정방향 시뮬레이션 기반의 가능도 기반 접근이, 경쟁하는 후보 모델들 중 가장 적절한 메커니즘적 네트워크 모델을 정확하게 선택할 수 있는가?
  • RQ2기존의 ABC 기반 모델 선택과 비교할 때, 제안된 방법의 정확성과 강건성은 어떠한가?
  • RQ3슈퍼러너 프레임워크는 개별 분류 알고리즘의 선택에 대해 얼마나 민감도를 감소시키는가?
  • RQ4생성 규칙의 미세한 차이를 가지는 메커니즘적 모델들을 얼마나 잘 구분할 수 있는가?
  • RQ5이 방법은 효모 단백질-단백질 상호작용 네트워크와 같은 실제 생물학적 네트워크 데이터에 효과적으로 적용될 수 있는가?

주요 결과

  • 제안된 방법은 시뮬레이션 연구에서 높은 정확도로 경쟁하는 메커니즘적 네트워크 모델을 효과적으로 구분하였다.
  • 슈퍼러너의 사용은 여러 학습 알고리즘을 조합함으로써 최적의 알고리즘을 사전에 선정할 필요 없이 모델 선택의 강건성을 크게 향상시켰다.
  • 정방향 시뮬레이션과 요약 통계량에 기반함으로써 가능도 계산이 어려운 문제를 효과적으로 처리하였으며, 분석적 가능도 계산이 필요 없었다.
  • 핵심 네트워크 특성(예: 차수 분포, 전이성)을 일치시켜 모델 校정을 수행함으로써 시뮬레이션된 네트워크가 관측된 데이터와 유사해지도록 보장하였다.
  • 모델 선택에 대한 불확실성 측정이 가능해져 선택된 모델에 대한 신뢰도를 제공하였다.
  • 이 방법은 실제 효모 단백질-단백질 상호작용 네트워크에 성공적으로 적용되었으며, 시스템 생물학 분야에서의 실용적 유용성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.