Skip to main content
QUICK REVIEW

[논문 리뷰] Local Algorithms for Block Models with Side Information

Elchanan Mossel, Jiaming Xu|arXiv (Cornell University)|2015. 08. 10.
Machine Learning and Algorithms참고 문헌 42인용 수 3
한 줄 요약

이 논문은 희박한 스토하스틱 블록 모델에서 측면 정보(상관된 정점 레이블)가 제공될 경우, 국소 알고리즘, 특히 국소 이웃에 대한 신뢰도 전파를 사용하는 알고리즘이 커뮤니티 탐지에서 최적 성능을 달성함을 보여준다. 측면 정보가 없는 대칭 블록 모델에서는 국소 알고리즘이 최적 성능을 내지 못하는 것과는 달리, 측면 정보의 존재로 인해 국소 방법은 세 가지의 서로 다른 매개변수 영역에서 정점의 정확하게 레이블이 지정된 비율을 최대화할 수 있다.

ABSTRACT

There has been a recent interest in understanding the power of local algorithms for optimization and inference problems on sparse graphs. Gamarnik and Sudan (2014) showed that local algorithms are weaker than global algorithms for finding large independent sets in sparse random regular graphs. Montanari (2015) showed that local algorithms are suboptimal for finding a community with high connectivity in the sparse Erdős-Rényi random graphs. For the symmetric planted partition problem (also named community detection for the block models) on sparse graphs, a simple observation is that local algorithms cannot have non-trivial performance. In this work we consider the effect of side information on local algorithms for community detection under the binary symmetric stochastic block model. In the block model with side information each of the $n$ vertices is labeled $+$ or $-$ independently and uniformly at random; each pair of vertices is connected independently with probability $a/n$ if both of them have the same label or $b/n$ otherwise. The goal is to estimate the underlying vertex labeling given 1) the graph structure and 2) side information in the form of a vertex labeling positively correlated with the true one. Assuming that the ratio between in and out degree $a/b$ is $Θ(1)$ and the average degree $ (a+b) / 2 = n^{o(1)}$, we characterize three different regimes under which a local algorithm, namely, belief propagation run on the local neighborhoods, maximizes the expected fraction of vertices labeled correctly. Thus, in contrast to the case of symmetric block models without side information, we show that local algorithms can achieve optimal performance for the block model with side information.

연구 동기 및 목표

  • 측면 정보(정점 레이블에 대한 정보)가 제공될 경우 국소 알고리즘이 커뮤니티 탐지에서 최적 성능을 달성할 수 있는지 조사하는 것.
  • 측면 정보가 없을 경우 일반적으로 실패하는 국소 방법과는 대조적으로, 희박한 스토하스틱 블록 모델에서 국소 및 글로벌 알고리즘 간의 격차를 해소하는 것.
  • 신뢰도 전파가 국소 이웃에 대해 적용되었을 때 정점의 정확하게 레이블이 지정된 비율을 최대화하는 매개변수 영역을 규명하는 것.
  • 대수도 한계에서 밀도 진동 및 가우시안 근사 기법을 사용하여 신뢰도 전파의 渐近 성능을 분석하는 것.

제안 방법

  • 측면 정보가 있는 이진 대칭 스토하스틱 블록 모델을 수식적으로 정의: 각 정점은 독립적으로 + 또는 −로 레이블이 지정되며, 같은 레이블을 가진 정점 간에는 확률 a/n, 다른 레이블을 가진 정점 간에는 확률 b/n 으로 간선이 생성된다.
  • 그래프의 구조와 측면 정보를 모두 활용하여 국소 이웃(반경 o(log n))에서 정점 레이블을 추정하기 위해 신뢰도 전파를 적용한다.
  • 메시지 분산과 믿음 갱신 동역학을 유도하기 위해 밀도 진동 기법과 가우시안 근사를 사용하여 재귀적 식을 유도한다.
  • 재귀식의 固定点을 분석하여 정점의 정확하게 레이블이 지정된 비율의 渐近 기대값을 규명한다.
  • 대칭성과 모멘트 매칭 논증을 활용하여, 특정 영역에서 신뢰도 전파의 기대 성능가 이론적 최적값과 일치함을 증명한다.
  • 대수도 한계에서의 성능의 닫힌 형태 표현식을 유도하기 위해 분산 재귀식의 고정점을 활용한다 (a→∞).

실험 결과

연구 질문

  • RQ1측면 정보가 존재할 경우 국소 알고리즘이 커뮤니티 탐지에서 최적 성능을 달성할 수 있는가?
  • RQ2신뢰도 전파가 국소 이웃에 적용되었을 때 정점의 정확하게 레이블이 지정된 비율을 최대화하는 매개변수 영역은 어디인가?
  • RQ3측면 정보의 존재가 희박한 블록 모델에서 국소 알고리즘의 기본적인 한계를 어떻게 변화시키는가?
  • RQ4대수도 한계에서 신뢰도 전파의 渐近 성능은 무엇이며, 이는 최대로 달성 가능한 정확도와 어떻게 관련이 있는가?
  • RQ5성능의 상한과 하한이 수렴하는 조건은 무엇이며, 이는 국소 알고리즘이 최적임을 의미하는가?

주요 결과

  • 측면 정보가 있는 대칭 블록 모델에서, |a−b|<2 이고 모든 0<α<1/2 일 때, 국소 이웃에 대한 신뢰도 전파가 최적 성능을 달성한다.
  • 모든 0<α<1/2 에 대해 (a−b)²>C(a+b) 를 만족하는 어떤 상수 C 가 존재할 경우에도 최적성이 유지된다.
  • 모든 a,b 에 대해 레이블 오류 확률이 α∗∈(0,1/2) 이하이면, 신뢰도 전파가 최적 성능을 달성한다.
  • 대수도 한계(a→∞)에서, 정점의 정확하게 레이블이 지정된 비율의 기대값은 1−𝔼[Q((v∗+U)/√v∗)] 로 수렴하며, 여기서 v∗ 는 v=μ²h(v)/4 의 최소 고정점이다.
  • |μ|<2 이거나 α≤α∗ 일 때, 신뢰도 전파의 성능 상한과 글로벌 최적값이 일치하며, 이는 고정점 v∗ 가 유일하고 알고리즘이 최적임을 의미한다.
  • 신뢰도 전파 메시지의 분산 재귀식은 고정점으로 수렴하며, 성능의 상한과 하한 간의 차이가 한계에서 사라지므로 최적성은 확인된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.