Skip to main content
QUICK REVIEW

[논문 리뷰] Graph inference with clustering and false discovery rate control

Tabea Rebafka, Étienne Roquain|arXiv (Cornell University)|2019. 07. 23.
Bayesian Modeling and Causal Inference참고 문헌 39인용 수 6
한 줄 요약

이 논문은 노이즈가 있는 네트워크에서 유의미한 간선을 식별하기 위해 변동성 기반 기대최대화(VEМ)와 가짜 발현률(FDR) 제어를 통합한 새로운 그래프 추론 방법을 제안한다. 스토케스틱 블록 모형(SBM)에서의 매개수 추정치와 커뮤니티 구조를 활용하여, FDR를 제어하면서 진짜 발견률(TDR)을 최대화하며, 약간의 규칙성 조건 하에서 渐近적으로 최적의 성능을 달성한다.

ABSTRACT

In this paper, a noisy version of the stochastic block model (NSBM) is introduced and we investigate the three following statistical inferences in this model: estimation of the model parameters, clustering of the nodes and identification of the underlying graph. While the two first inferences are done by using a variational expectation-maximization (VEM) algorithm, the graph inference is done by controlling the false discovery rate (FDR), that is, the average proportion of errors among the edges declared significant, and by maximizing the true discovery rate (TDR), that is, the average proportion of edges declared significant among the true edges. Provided that the VEM algorithm provides reliable parameter estimates and clustering, we theoretically show that our procedure does control the FDR while satisfying an optimal TDR property, up to remainder terms that become small when the size of the graph grows. Numerical experiments show that our method outperforms the classical FDR controlling methods that ignore the underlying SBM topology. In addition, these simulations demonstrate that the FDR/TDR properties of our method are robust to model mis-specification, that is, are essentially maintained outside our model.

연구 동기 및 목표

  • 네트워크 데이터에서 클러스터링과 간선 유의성의 두 가지 요소를 동시에 모델링하는 통합된 프레임워크를 개발하기 위해.
  • 그래프 추론와 클러스터링을 별도로 수행하는 이단계적 접근 방식의 한계를 해결하기 위해.
  • 노이즈가 존재하는 상황에서 간선 선택 시 가짜 발현률(FDR)을 제어하면서 진짜 발견률(TDR)을 최대화하기 위해.
  • 노이즈가 있는 스토케스틱 블록 모형(NSBM) 하에서 FDR 제어와 TDR 최적성에 대한 이론적 보장을 확보하기 위해.
  • 실제 네트워크 환경에서 모형이 잘못 지정되었을 경우에도 방법의 강인성을 입증하기 위해.

제안 방법

  • 노드 소속의 클러스터링과 SBM 매개수 추정을 위해 변동성 기대최대화(VEM) 알고리즘을 사용한다.
  • 추정된 SBM 하에서 간선 검정 통계량을 기반으로 한 q-값을 활용한 새로운 FDR 제어 절차를 적용한다.
  • 기본 블록 구조를 고려하여 간선의 유의성 평가를 위해 ℓ-값과 q-값을 도입한다.
  • q-값에 대한 임계값 규칙을 적용하여 간선을 선택함으로써, 사전 설정된 수준 α에서 FDR 제어를 보장한다.
  • 추정된 SBM 매개수와 클러스터링 구조에 적응하여 TDR를 최대화하는 절차를 설계한다.
  • 이론적 분석은 q-값 함수의 연속성 및 안정성 성질과 농도 부등식에 기반한다.

실험 결과

연구 질문

  • RQ1클러스터링에서 유도된 잠재적 커뮤니티 구조를 통합함으로써 그래프 추론에서 FDR 제어를 향상시킬 수 있는가?
  • RQ2VEM 기반 클러스터링을 FDR 제어와 통합하면 기존 방법에 비해 더 높은 진짜 발견률을 달성할 수 있는가?
  • RQ3가정된 NSBM에서 벗어난 경우, 예를 들어 모형의 편이가 발생할 경우 제안된 방법은 어떻게 성능을 보이는가?
  • RQ4고차원 네트워크 환경에서 FDR 제어와 TDR 최적성에 대해 어떤 이론적 보장을 확보할 수 있는가?
  • RQ5기본 SBM 가정이 위반되었을 경우에도 방법이 강인한 성능을 유지할 수 있는가?

주요 결과

  • 제안된 방법은 명목 수준 α에서 FDR를 제어하며, 그래프 크기가 증가함에 따라 FDR이 점차 α에 수렴한다.
  • 이 방법은 네트워크 크기가 증가함에 따라 나머지 항이 사라지는 것까지 고려할 때 渐近적으로 최적의 진짜 발견률(TDR)을 달성한다.
  • 수치 실험 결과, 제안된 방법은 기존의 SBM 구조를 忽略하는 전통적인 FDR 제어 방법보다 뛰어난 성능을 보였다.
  • 데이터가 가정된 NSBM에서 벗어나도 FDR과 TDR 성질이 강인하게 유지되어 강력한 실용적 내구성을 입증하였다.
  • 이론적 분석을 통해 SBM 매개수와 간선 분포에 대한 온건한 규칙성 조건 하에서 FDR 제어와 TDR 최적성이 유지됨을 확인하였다.
  • VEM 추정치가 일致적임을 입증하였고, 추정 오차가 중간 수준일 경우에도 절차가 효과적으로 유지됨을 보여, 매개수 추정 불확실성에 대해 성능이 안정됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.