Skip to main content
QUICK REVIEW

[논문 리뷰] On Graph Stream Clustering with Side Information

Yuchen Zhao, Philip S. Yu|arXiv (Cornell University)|2013. 01. 28.
Complex Network Analysis Techniques참고 문헌 23인용 수 6
한 줄 요약

이 논문은 동적 그래프 스트림의 클러스터링을 위해 유일한 E-S 거리 측정법을 통해 링크 구조와 이질적인 보조 정보를 통합적으로 모델링하는 새로운 프레임워크인 GSSClu를 제안한다. DMO 최적화 프레임워크를 도입하여 스트림 처리 중 링크와 속성의 상대적 중요도를 동적으로 가중치를 부여하고, 일정한 메모리 공간을 사용하는 스케치 기반 통계 구조(SGS(C))를 활용하여 확장성 있고 효율적인 처리를 실현하여, 실제 그래프 스트림 데이터셋에서 기존 방법들에 비해 뛰어난 클러스터링 정확도와 효율성을 달성한다.

ABSTRACT

Graph clustering becomes an important problem due to emerging applications involving the web, social networks and bio-informatics. Recently, many such applications generate data in the form of streams. Clustering massive, dynamic graph streams is significantly challenging because of the complex structures of graphs and computational difficulties of continuous data. Meanwhile, a large volume of side information is associated with graphs, which can be of various types. The examples include the properties of users in social network activities, the meta attributes associated with web click graph streams and the location information in mobile communication networks. Such attributes contain extremely useful information and has the potential to improve the clustering process, but are neglected by most recent graph stream mining techniques. In this paper, we define a unified distance measure on both link structures and side attributes for clustering. In addition, we propose a novel optimization framework DMO, which can dynamically optimize the distance metric and make it adapt to the newly received stream data. We further introduce a carefully designed statistics SGS(C) which consume constant storage spaces with the progression of streams. We demonstrate that the statistics maintained are sufficient for the clustering process as well as the distance optimization and can be scalable to massive graphs with side attributes. We will present experiment results to show the advantages of the approach in graph stream clustering with both links and side information over the baselines.

연구 동기 및 목표

  • 링크 구조와 보조 정보(예: 사용자 프로필, 메타데이터)가 존재하지만 활용되지 않는 거대하고 동적인 그래프 스트림의 클러스터링 문제를 해결한다.
  • 기존의 그래프 스트림 클러스터링 방법들이 보조 정보를 忽시하고 고속도, 고용량 데이터를 처리할 수 없는 확장성 한계를 극복한다.
  • 구조적 유사성과 속성 수준의 유사성을 체계적으로 통합하는 통합된 거리 측정법을 개발한다.
  • 스트림 처리 중 링크와 보조 속성의 상대적 중요도를 동적으로 학습하는 효율적인 온라인 최적화 프레임워크(DMO)를 설계한다.
  • 일정한 메모리 소비를 보장하는 스케치 기반 통계 구조(SGS(C))를 활용하여 대규모 그래프에 확장 가능하도록 보장한다.

제안 방법

  • 그래프 링크 구조 유사성과 보조 속성 유사성을 가중 조합을 통해 통합하는 유일한 거리 측정법인 E-S 거리 측정법을 제안한다.
  • 클러스터 간 거리의 최소화와 클러스터 내 거리의 최대화를 통해 링크와 보조 속성의 가중치를 반복적으로 개선하는 DMO(Dynamic Metric Optimization) 프레임워크를 도입한다.
  • 그래프 엣지와 보조 속성의 압축된 실시간 요약을 유지하기 위해 스케치 기반의 통계 구조 SGS(C)를 활용하여 일정한 메모리 공간과 효율적인 계산을 가능하게 한다.
  • SGS(C)를 사용하여 DMO 프레임워크에서 필요한 모든 거리 측정과 최적화 목표를 원시 데이터를 저장하지 않고 추정한다.
  • E-S 거리 측정법과 DMO 프레임워크를 스트리밍 클러스터링 파이프라인에 적용하여 각 도착하는 그래프 객체를 최소한의 오버헤드로 점진적으로 처리한다.
  • 최적화 과정과 클러스터링 과정을 하나의 온라인 알고리즘으로 통합하여 시간이 지남에 따라 변화하는 데이터 분포에 적응한다.

실험 결과

연구 질문

  • RQ1통합된 거리 측정법이 그래프 스트림 클러스터링에서 구조적 정보와 보조 속성 정보를 효과적으로 통합할 수 있는가?
  • RQ2온라인 스트림 환경에서 링크와 보조 속성의 상대적 중요도를 어떻게 동적으로 학습하고 업데이트할 수 있는가?
  • RQ3일정한 메모리 공간을 사용하는 스케치 기반 통계 구조(SGS(C))가 그래프 스트림에서 클러스터링과 거리 측정 최적화에 필요한 충분한 정보를 유지할 수 있는가?
  • RQ4보조 정보를 忽시하는 기존 방법들에 비해 제안된 방법의 클러스터링 정확도와 효율성은 어떠한가?
  • RQ5클러스터 수와 최적화 빈도(γ)와 같은 핵심 파라미터의 변화에 대해 이 방법은 얼마나 강인한가?

주요 결과

  • 제안된 GSSClu 방법은 특히 보조 정보가 유용한 경우 기존 방법들에 비해 클러스터링 순도에서 뚜렷한 우월성을 보이며, 이질적 속성의 통합이 가치가 있음을 입증한다.
  • 클러스터 수가 두 배로 증가할 때 순도 점수가 뿐만 아니라 약 0.03 정도로만 증가하여, 다양한 클러스터 설정에서 일관된 성능과 k에 대한 강인성을 보여준다.
  • GSSClu의 처리 속도는 클러스터 수에 따라 선형적으로 증가하며, 작은 k 값에서 더 높은 처리 속도를 기록하여 효율적인 거리 계산과 양호한 확장성을 확인한다.
  • 최적화 빈도 파라미터 γ의 다양한 설정에서도 안정적인 처리 속도를 유지하며, 높은 최적화 빈도(작은 γ)에서만 약간의 성능 저하가 발생하여 DMO의 오버헤드가 낮음을 시사한다.
  • 민감도 분석 결과, γ와 k 값의 변화에 대해 성능과 효율성에 미치는 영향이 최소한으로 제한되어 있어 방법의 강인성을 입증한다.
  • 스케치 기반의 SGS(C) 구조는 일정한 메모리 공간을 유지하면서도 정확한 거리 추정과 최적화 목표 추정을 가능하게 하여, 대규모 그래프 스트림에 대한 확장성을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.