Skip to main content
QUICK REVIEW

[논문 리뷰] Vertex-Context Sampling for Weighted Network Embedding

Chih‐Ming Chen, Yi‐Hsuan Yang|arXiv (Cornell University)|2017. 11. 01.
Advanced Graph Neural Networks참고 문헌 16인용 수 4
한 줄 요약

이 논문은 네트워크 임베딩을 향상시키기 위해 균일한 샘플링을 가중치가 부여되고 맥락을 고려하는 샘플링으로 대체하는 가중치가 부여된 정점-맥락 샘플링(VCS) 프레임워크를 제안한다. 이 방법은 간선 가중치를 유지하고 표현 품질을 향상시킨다. 순차적 정점-맥락 그래프 구조를 사용하여 일정 시간 내 샘플링을 구현함으로써, 효율적이고 메모리 사용이 적은 훈련을 가능하게 하며, 유사도 검색, 분류, 추천 작업에서 균일한 샘플링 및 최신 기술보다 뛰어난 성능을 발휘한다.

ABSTRACT

In recent years, network embedding methods have garnered increasing attention because of their effectiveness in various information retrieval tasks. The goal is to learn low-dimensional representations of vertexes in an information network and simultaneously capture and preserve the network structure. Critical to the performance of a network embedding method is how the edges/vertexes of the network is sampled for the learning process. Many existing methods adopt a uniform sampling method to reduce learning complexity, but when the network is non-uniform (i.e. a weighted network) such uniform sampling incurs information loss. The goal of this paper is to present a generalized vertex sampling framework that works seamlessly with most existing network embedding methods to support weighted instead of uniform vertex/edge sampling. For efficiency, we propose a delicate sequential vertex-to-context graph data structure, such that sampling a training pair for learning takes only constant time. For scalability and memory efficiency, we design the graph data structure in a way that keeps space consumption low without requiring additional space. In addition to implementing existing network embedding methods, the proposed framework can be used to implement extensions that feature high-order proximity modeling and weighted relation modeling. Experiments conducted on three datasets, including a commercial large-scale one, verify the effectiveness and efficiency of the proposed weighted network embedding methods on a variety of tasks, including word similarity search, multi-label classification, and item recommendation.

연구 동기 및 목표

  • 가중치가 있는 네트워크에서 균일한 샘플링의 한계를 해결한다. 이는 간선 가중치 정보를 忽시하고 표현 품질을 떨어뜨린다.
  • 기존 네트워크 임베딩 방법과 호환되는 확장성 있고 메모리 효율적인 샘플링 프레임워크를 개발한다.
  • 통합된 샘플링 프레임워크 내에서 고차원 근접성과 가중치가 부여된 관계 모델링을 가능하게 한다.
  • 사전 계산이나 큰 데이터 구조 없이도 일정 시간 내 샘플링과 낮은 메모리 사용을 동시에 달성한다.
  • 다양한 최종 작업에서 실제 세계 및 대규모 데이터셋에서 뛰어난 성능을 입증한다.

제안 방법

  • O(1) 샘플링을 가능하게 하기 위해 연결 관계를 압축된 순차적 형식으로 저장하는 순차적 정점-맥락 그래프 데이터 구조를 도입한다.
  • 간선 가중치에 기반해 더 강한 간선을 우선시하는 가중치가 부여된 정점-맥락 샘플링 함수를 설계하여 균일한 샘플링을 대체한다.
  • 정점 특성에 따라 네트워크를 하위 네트워크로 분해하여 효율적이고 국소화된 샘플링을 가능하게 한다.
  • 기존 네트워크 임베딩 모델(LINE, DeepWalk, node2vec 등)의 핵심 최적화 절차를 수정하지 않고 VCS 프레임워크를 통합한다.
  • 샘플링 프레임워크의 유연성을 활용해 고차원 근접성 및 가중치가 부여된 관계 모델링을 위한 확장 기능을 지원한다.
  • 사전 계산 없이 실시간으로 샘플링과 훈련을 수행함으로써, 랜덤 워크나 큰 중간 데이터 구조의 사전 계산을 피한다.

실험 결과

연구 질문

  • RQ1가중치가 있는 네트워크에서 균일한 샘플링과 비교해 가중치가 부여된 샘플링 전략이 네트워크 임베딩 성능을 향상시킬 수 있는가?
  • RQ2일정 시간 내 쌍 샘플링을 달성하면서도 낮은 메모리 사용을 유지할 수 있는 샘플링 프레임워크를 설계할 수 있는가?
  • RQ3제안된 프레임워크는 네트워크 임베딩 내에서 고차원 근접성과 가중치가 부여된 관계를 효과적으로 모델링할 수 있는가?
  • RQ4대규모 네트워크에서 기존 방법과 비교해 VCS 기반 방법의 메모리 사용 및 실행 시간 면에서 확장성은 어떠한가?
  • RQ5실제 작업, 예를 들어 추천 및 유사도 검색에서 가중치가 부여된 샘플링이 성능 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 VCS 기반 네트워크 임베딩 방법은 KKBOX 온라인 추천 작업에서 mAP 14.5%를 달성하여, DeepWalk(6.8%)와 균일한 VCS-HPE(8.2%)를 크게 앞서나갔다.
  • Movielens-20M 데이터셋에서 비균일한 VCS-HPE 방법은 영화-영화 추천에서 DeepWalk를 초월했으며, 희귀하지만 정보가 풍부한 아이템을 고려할 경우 특히 두드러진 성능 향상을 보였다.
  • VCS 기반 접근의 메모리 사용은 LINE 및 DeepWalk(단일 워크 타임 기준)와 유사했으며, node2vec의 간선-간선 그래프 구조보다 1/10 미만이었다.
  • 멀티스레딩을 사용할 경우, 원래의 LINE 알고리즘보다 2배 빠른 성능 향상을 기록했으며, LINE은 이미 확장성 최적화가 되어 있었다.
  • 균일한 샘플링과 비균일한 VCS-HPE 간의 성능 격차는 특히 평점 기반 가중치를 통한 사용자 선호도를 포착함으로써 가중치 샘플링의 효과를 확인했다.
  • 계산 또는 메모리 오버헤드 증가 없이도 고차원 근접성 및 가중치가 부여된 관계 모델링을 성공적으로 구현했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.