Skip to main content
QUICK REVIEW

[논문 리뷰] Non-linear Attributed Graph Clustering by Symmetric NMF with PU Learning

Seiji Maekawa, Koh Takeuchi|arXiv (Cornell University)|2018. 09. 21.
Face and Expression Recognition참고 문헌 26인용 수 8
한 줄 요약

이 논문은 대칭 비음수 행렬 분해(SNMF)와 양성-무작위(PU) 학습을 활용한 비선형 소유 그래프 클러스터링 방법인 NAGC를 제안한다. 이는 그래프의 구조적 특성과 정점 속성 간의 복잡한 관계를 포착한다. 구조적 클러스터링과 속성 기반 클러스터링 간의 비선형 투영을 학습하고, 부분적으로 관측된 양성 간선을 처리하기 위해 PU 학습을 활용함으로써 뛰어난 클러스터링 품질과 효율성을 달성한다. 계산 복잡도는 $O((n^2 + mn)kt)$이며, 실제 데이터셋에서 기존 방법들을 능가한다.

ABSTRACT

We consider the clustering problem of attributed graphs. Our challenge is how we can design an effective and efficient clustering method that precisely captures the hidden relationship between the topology and the attributes in real-world graphs. We propose Non-linear Attributed Graph Clustering by Symmetric Non-negative Matrix Factorization with Positive Unlabeled Learning. The features of our method are three holds. 1) it learns a non-linear projection function between the different cluster assignments of the topology and the attributes of graphs so as to capture the complicated relationship between the topology and the attributes in real-world graphs, 2) it leverages the positive unlabeled learning to take the effect of partially observed positive edges into the cluster assignment, and 3) it achieves efficient computational complexity, $O((n^2+mn)kt)$, where $n$ is the vertex size, $m$ is the attribute size, $k$ is the number of clusters, and $t$ is the number of iterations for learning the cluster assignment. We conducted experiments extensively for various clustering methods with various real datasets to validate that our method outperforms the former clustering methods regarding the clustering quality.

연구 동기 및 목표

  • 구조와 속성이 서로 다른 복잡한 클러스터 구조를 보이는 소유 그래프의 클러스터링 문제를 해결하기 위해.
  • 구조적 클러스터링과 속성 기반 클러스터링 간의 비선형 관계를 모델링하여 클러스터링 품질을 향상시키기 위해.
  • 관측되지 않은 간선이 음성으로 간주되지 않는 개방형 세계 가정을 처리하기 위해 PU 학습을 통합하여, 누락된 양성 간선에 대한 강건성을 향상시키기 위해.
  • 속성 차원 수에 따라 제곱형 비용이 발생하지 않도록 하여 고차원 속성에 대해 확장 가능한 효율적인 알고리즘을 설계하기 위해.
  • 완전한 감독 정보나 레이블이 지정된 음성 간선이 없이도 높은 성능을 달성하기 위해.

제안 방법

  • 이 방법은 그래프의 구조적 특성과 정점 속성에서 동시에 클러스터링 할당을 공동으로 학습하기 위해 대칭 비음수 행렬 분해(SNMF)를 사용한다.
  • 구조적 클러스터링과 속성 기반 클러스터링의 잠재 공간 간에 비선형 투영 함수를 학습하여 복잡한 비선형 관계를 모델링한다.
  • 개방형 세계 가정을 모델링하기 위해 양성-무작위(PU) 학습을 통합하여, 관측되지 않은 간선이 음성으로 간주되지 않음을 반영함으로써 누락된 양성 간선에 대한 강건성을 향상시킨다.
  • 목적 함수는 구조적 및 속성 기반 클러스터링을 위한 SNMF와, 관측되지 않은 간선을 음성으로 잘못 분류하는 것을 방지하기 위한 PU 학습 성분을 통합한다.
  • 계산 효율성을 유지하기 위해 닫힌 형태의 업데이트를 사용하는 교차 최적화 알고리즘을 적용하여 $O((n^2 + mn)kt)$의 복잡도를 달성한다.
  • 속성 학습 과정에서 비용이 많이 드는 $O(m^2)$ 연산을 피하여 고차원 속성에 대한 확장성을 확보한다.

실험 결과

연구 질문

  • RQ1구조적 클러스터링과 속성 기반 클러스터링 간의 비선형 투영이 소유 그래프의 클러스터링 정확도를 향상시키는가?
  • RQ2PU 학습은 개방형 세계 가정 하에서 부분적으로 관측된 양성 간선을 효과적으로 처리할 수 있는가?
  • RQ3특히 고차원 속성을 가진 경우에도, 복잡한 구조-속성 관계를 포착하면서 높은 효율성을 유지하는가?
  • RQ4JWNMF와 BAGC와 같은 기존의 소유 그래프 클러스터링 방법과 비교해 성능 및 확장성 면에서 어떻게 성과를 내는가?
  • RQ5실제 데이터셋에서 속성과 간선의 희소성 수준이 다양할 경우, 하이퍼파rameter 선택에 대해 강건한가?

주요 결과

  • 제안된 방법인 NAGC는 WebKB, Citeseer, Cora, polblog 등 평가된 모든 데이터셋에서 JWNMF와 BAGC와 같은 기존 방법들을 능가하는 클러스터링 품질을 달성한다.
  • WebKB에서 NAGC는 2.62초, Citeseer에서는 54.32초의 런타임을 기록하여 고속성 속성 데이터셋에서 JWNMF(8.80초 및 60.71초)보다 뚜렷이 빠른 성능을 보였다.
  • 절단 실험 결과, PU 학습을 제거한 경우(WebKB 기준 0.81초) 런타임이 감소함을 확인하여, PU 학습이 추가적인 구조 업데이트로 인해 계산 비용을 증가시킨다는 것을 입증했다.
  • 속성 수가 많아지는 상황에서도 높은 클러스터링 품질을 유지함으로써, 고차원 데이터에 대한 확장성과 강건성을 입증했다.
  • 하이퍼파rameter 설정에 관계없이 일관된 성능 향상을 보이며, 파라미터 튜닝에 대한 민감도가 낮음을 확인하여 안정성을 입증했다.
  • PU 학습 통합으로 인해 관측되지 않은 간선를 음성으로 간주하지 않고 미지 상태로 모델링함으로써 더 정확한 클러스터링 할당이 가능해졌으며, 간선 정보가 불완전한 실제 그래프에서 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.