Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Representation of Subgraphs

Bijaya Adhikari, Yao Zhang|arXiv (Cornell University)|2017. 02. 22.
Advanced Graph Neural Networks참고 문헌 21인용 수 6
한 줄 요약

이 논문은 문단 벡터 기반 프레임워크를 응용하여 국소적 유사성을 유지함으로써 임의의 부분그래프에 대한 분산 표현을 학습하는 비지도 스케일러블 알고리즘인 Sub2Vec을 제안한다. 커뮤니티 탐지에서 노드 임베딩보다 최대 4배 빠르게 성능을 높이며, 다양한 실세계 네트워크에서 링크 예측 작업에서도 뛰어난 성능을 보인다.

ABSTRACT

Network embeddings have become very popular in learning effective feature representations of networks. Motivated by the recent successes of embeddings in natural language processing, researchers have tried to find network embeddings in order to exploit machine learning algorithms for mining tasks like node classification and edge prediction. However, most of the work focuses on finding distributed representations of nodes, which are inherently ill-suited to tasks such as community detection which are intuitively dependent on subgraphs. Here, we propose sub2vec, an unsupervised scalable algorithm to learn feature representations of arbitrary subgraphs. We provide means to characterize similarties between subgraphs and provide theoretical analysis of sub2vec and demonstrate that it preserves the so-called local proximity. We also highlight the usability of sub2vec by leveraging it for network mining tasks, like community detection. We show that sub2vec gets significant gains over state-of-the-art methods and node-embedding methods. In particular, sub2vec offers an approach to generate a richer vocabulary of features of subgraphs to support representation and reasoning.

연구 동기 및 목표

  • 커뮤니티 탐지와 같은 작업에 핵심적인 역할을 하지만 노드 수준의 임베딩에 비해 다소 미흡하게 다뤄진 부분그래프에 대한 분산 표현 학습의 격차를 메운다.
  • 구조적 유사성을 유지하면서 임의의 부분그래프에 대한 저차원 벡터 표현을 생성할 수 있는 확장 가능한 방법을 개발한다.
  • 언어 모델링 도구를 활용한 이론적 근거를 제공하여, word2vec 및 PV-DBOW/PV-DM와 유사한 방식으로 부분그래프 임베딩을 정당화한다.
  • 커뮤니티 탐지 및 링크 예측과 같은 후행 네트워크 마이닝 작업에서 부분그래프 임베딩의 유용성을 입증한다.

제안 방법

  • 자연어 처리에서의 문단 벡터(PV-DBOW 및 PV-DM) 프레임워크를 부분그래프 임베딩에 응용하여 각 부분그래프를 '문단'으로 간주한다.
  • 공통된 노드, 간선 및 경로를 기반으로 부분그래프 간의 구조적 유사도를 측정하는 국소적 유사성 정의.
  • 부정 샘플링과 확률적 경사 하강법을 사용하여 각 부분그래프 주변의 중간 이웃을 관찰할 확률을 최적화한다.
  • 국소적 유사성이 높은 부분그래프들이 벡터 공간에서 가까이 위치하도록 d차원 임베딩을 학습한다.
  • 각 부분그래프의 이웃에서 공통된 부분 구조를 관찰할 확률을 최대화함으로써 국소적 유사성을 유지한다.
  • 노드 수준의 임베딩을 초월하여 유 directed 및 undirected 그래프를 모두 지원하는 일반화된 프레임워크를 제공한다.

실험 결과

연구 질문

  • RQ1국소적 유사성을 유지하는 의미 있는 저차원 분산 표현을 임의의 부분그래프에 대해 학습할 수 있는가?
  • RQ2임베딩 과정을 이끄는 데 사용할 수 있는 부분그래프 간의 국소적 유사성을 정의하고 수식화할 수 있는가?
  • RQ3커뮤니티 탐지와 같은 부분그래프 기반 네트워크 마이닝 작업에서 부분그래프 임베딩이 노드 수준의 임베딩을 능가할 수 있는가?
  • RQ4기존 방법과 비교해 볼 때 Sub2Vec은 대규모이고 다양한 실세계 네트워크에서 어떻게 확장 가능한가?
  • RQ5국소적 유사성 기반 임베딩이 실패하는 상황는 언제이며, 위치적 또는 구조적 유사성과 같은 대체 유사성 측정 기준은 성능 향상에 기여할 수 있는가?

주요 결과

  • Sub2Vec은 Node2Vec과 같은 최신 노드 임베딩 방법보다 커뮤니티 탐지 정확도에서 최대 4배 향상된다.
  • Facebook 네트워크에서 Sub2Vec(PV-DM)는 간선 제거 비율 40%일 때 평균 정밀도 0.78을 기록하여 Node2Vec(0.45) 및 기타 기준 방법을 능가한다.
  • 링크 예측 작업에서는 특히 간선 제거 비율이 낮은 경우(P = 40–50%), 밀도가 높은 네트워크에서 Sub2Vec이 노드 임베딩을 일관되게 능가한다.
  • 간선 제거 비율이 높아지는 경우(P = 60), 네트워크의 희박성이 증가하고 부분그래프 간의 겹침이 줄어들면서 Sub2Vec의 성능이 저하된다.
  • Sub2Vec은 노드 수준의 추상화를 초월하여 추론과 표현 학습을 지원하는 더 풍부한 부분그래프 특징 어휘를 제공한다.
  • 이론적 분석을 통해 Sub2Vec이 국소적 유사성을 유지함을 확인하였으며, 언어 모델링 및 word2vec 원리와 일치함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.