Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Networks from Random Walk-Based Node Similarities

Jeremy G. Hoskins, Cameron Musco|arXiv (Cornell University)|2018. 01. 23.
Complex Network Analysis Techniques참고 문헌 47인용 수 3
한 줄 요약

이 논문은 랜덤 워크 기반의 노드 유사도인 효과적 저항 측정값의 소규모이고 노이즈가 있는 부분집합에서 볼록 및 비볼록 최적화를 사용하여 사회적 네트워크 그래프를 재구성하는 방법을 제안한다. 심지어 효과적 저항 측정값의 10–25%만으로도 진짜 간선의 20% 이상을 회복하고 모든 쌍 간 유사도를 정확하게 근사할 수 있음을 보여주며, 이러한 데이터를 공개할 경우 심각한 프라이버시 위험이 있음을 드러낸다.

ABSTRACT

Digital presence in the world of online social media entails significant privacy risks. In this work we consider a privacy threat to a social network in which an attacker has access to a subset of random walk-based node similarities, such as effective resistances (i.e., commute times) or personalized PageRank scores. Using these similarities, the attacker's goal is to infer as much information as possible about the underlying network, including any remaining unknown pairwise node similarities and edges. For the effective resistance metric, we show that with just a small subset of measurements, the attacker can learn a large fraction of edges in a social network, even when the measurements are noisy. We also show that it is possible to learn a graph which accurately matches the underlying network on all other effective resistances. This second observation is interesting from a data mining perspective, since it can be expensive to accurately compute all effective resistances. As an alternative, our graphs learned from just a subset of approximate effective resistances can be used as surrogates in a wide range of applications that use effective resistances to probe graph structure, including for graph clustering, node centrality evaluation, and anomaly detection. We obtain our results by formalizing the graph learning objective mathematically, using two optimization problems. One formulation is convex and can be solved provably in polynomial time. The other is not, but we solve it efficiently with projected gradient and coordinate descent. We demonstrate the effectiveness of these methods on a number of social networks obtained from Facebook. We also discuss how our methods can be generalized to other random walk-based similarities, such as personalized PageRank. Our code is available at https://github.com/cnmusco/graph-similarity-learning.

연구 동기 및 목표

  • 작은, 노이즈가 있는 랜덤 워크 기반의 노드 유사도, 특히 효과적 저항 측정값으로부터 네트워크의 어떤 정도의 구조적 정보를 유추할 수 있는지 조사하기 위해.
  • 관측된 부분 측정값만을 사용하여 원래 네트워크의 모든 쌍 간 효과적 저항에 대해 일치하는 그래프를 학습하기 위한 효율적인 최적화 방법 개발.
  • 효과적 저항 또는 유사한 지표를 공개할 경우, 민감한 네트워크 구조를 폭 드러낼 수 있다는 점을 감안해 프라이버시 영향 평가.
  • 모든 쌍 간 유사도 계산이 불가능한 경우를 대비해 학습된 대체 그래프를 사용하여 확장 가능한 그래프 마이닝을 가능하게 하기 위해.

제안 방법

  • 관측된 효과적 저항와 예측된 효과적 저항 간 최소 제곱 오차를 최소화하는 최적화 문제로 그래프 학습을 수식화한다.
  • 이deal 조건 하에서 그래프를 증명 가능하게 복원할 수 있는 정수형 프로그래밍을 사용한 볼록 형식을 제안한다.
  • 대규모 네트워크에서 확장성 있고 효율적인 학습을 위해 프로젝션 기반 경사 하강법과 좌표 하강법을 사용한 비볼록 최적화 접근법을 개발한다.
  • 실제 그래프에서 수렴성과 확장성을 향상시키기 위해 5,000개의 제약 조건을 랜덤 블록으로 사용한 블록 좌표 하강법을 적용한다.
  • 다양한 노이즈 수준과 샘플링 비율을 가진 실제 페이스북 에고 네트워크에 최소 제곱 형식을 적용한다.
  • 다른 크기의 네트워크 간 공정한 비교를 가능하게 하기 위해 목적함수와 오차 지표를 정규화한다.

실험 결과

연구 질문

  • RQ1소규모이고 노이즈가 있는 효과적 저항 측정값의 부분집합이 진짜 네트워크 구조, 즉 간선과 전반적인 위상 구조의 상당한 비율을 드러낼 수 있는가?
  • RQ2관측된 측정값의 일부만을 사용할 때, 학습된 그래프가 원래 네트워크의 모든 쌍 간 효과적 저항을 얼마나 정확히 근사할 수 있는가?
  • RQ3그래프 재구성의 품질이 측정된 제약 조건의 수와 측정값의 노이즈 수준에 따라 어느 정도 의존하는가?
  • RQ4제안된 최적화 방법이 실제 사회 네트워크에 확장 가능하면서도 간선 복원률과 유사도 일치 정확도를 유지할 수 있는가?
  • RQ5온라인 사회 네트워크에서 효과적 저항 또는 유사한 랜덤 워크 기반 유사도를 공개할 경우 프라이버시에 어떤 영향을 미치는가?

주요 결과

  • 소규모 페이스북 에고 네트워크(FB Small A 및 FB Small C)에서 효과적 저항 측정값의 10%만을 사용해도 진짜 간선의 50% 이상을 복원하였다.
  • 더 큰 페이스북 네트워크에서는 관측된 제약 조건의 비율이 10%일지라도 진짜 간선의 20% 이상을 복원하였으며, 노이즈가 적고 샘플링 비율이 높을수록 성능이 향상되었다.
  • 일반화 오차—학습된 그래프가 원래 네트워크의 모든 효과적 저항에 대해 얼마나 잘 맞는지를 측정하는 지표—는 일관되게 낮았으며, 이는 정확한 전반적 구조 복원을 의미한다.
  • 최소 제곱 형식이 실질적으로 볼록 정수형 프로그래밍보다 뛰어났으며, 특히 제약 조건 집합이 작을 경우 확장성과 수렴성 측면에서 더 우수했다.
  • 학습된 그래프에서 가장 무거운 간선들이 원래 네트워크의 진짜 간선과 매우 가까이 일치했으며, 격자 그래프에서 시각적으로 확인했을 때 224개의 가장 무거운 간선이 정확히 격자 구조를 반영했다.
  • 어떤 경우에서는 더 적은 제약 조건을 사용할수록 간선 복원률이 향상되었으며, 이는 더 흐린, 더 고품질의 측정값 집합에서 최적화 수렴이 더 효과적일 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.