Skip to main content
QUICK REVIEW

[논문 리뷰] Online matrix factorization for Markovian data and applications to Network Dictionary Learning

Hanbaek Lyu, Deanna Needell|arXiv (Cornell University)|2019. 11. 05.
Sparse and Compressive Sensing Techniques참고 문헌 48인용 수 11
한 줄 요약

이 논문은 종속된 데이터, 즉 약한 혼합 조건을 만족하는 마르코프 체인으로 모델링된 데이터에서도 기대 손실 함수의 임계점으로 거의 확실히 수렴하는 온라인 행렬 분해(OMF) 알고리즘을 제안한다. 이 방법은 표본 추출 없이 종속된 데이터 스트림으로부터 효율적인 특징 추출을 가능하게 하며, 실세계 네트워크에서 네트워크 모티프 추출 및 노이즈 제거에 적용된다.

ABSTRACT

Online Matrix Factorization (OMF) is a fundamental tool for dictionary learning problems, giving an approximate representation of complex data sets in terms of a reduced number of extracted features. Convergence guarantees for most of the OMF algorithms in the literature assume independence between data matrices, and the case of dependent data streams remains largely unexplored. In this paper, we show that a non-convex generalization of the well-known OMF algorithm for i.i.d. stream of data in \citep{mairal2010online} converges almost surely to the set of critical points of the expected loss function, even when the data matrices are functions of some underlying Markov chain satisfying a mild mixing condition. This allows one to extract features more efficiently from dependent data streams, as there is no need to subsample the data sequence to approximately satisfy the independence assumption. As the main application, by combining online non-negative matrix factorization and a recent MCMC algorithm for sampling motifs from networks, we propose a novel framework of Network Dictionary Learning, which extracts ``network dictionary patches' from a given network in an online manner that encodes main features of the network. We demonstrate this technique and its application to network denoising problems on real-world network data.

연구 동기 및 목표

  • 데이터가 i.i.d.가 아니라 종속된 경우 온라인 행렬 분해(OMF)의 수렴 보장을 확보할 수 있는 데에 초점을 맞춘다.
  • 약한 혼합 조건을 만족하는 마르코프 연속체 데이터 스트림에서 OMF의 이론적 수렴을 확장한다.
  • 지역 하위그래프 패턴(모티프)을 온라인 방식으로 추출할 수 있는 새로운 네트워크 데이터 분석 프레임워크인 네트워크 딕셔너리 학습(NDL)을 개발한다.
  • 독립성을 확보하기 위해 표본 추출 없이 종속된 네트워크 데이터 스트림으로부터 효율적인 실시간 특징 추출을 가능하게 한다.
  • 마르코프 종속성 하에서 OMF의 일반화를 통해 제안된 NDL 프레임워크의 이론적 수렴 보장을 제공한다.

제안 방법

  • 기본적으로 마르코프 체인에 의해 생성되는 데이터 스트림에 대해 [33]의 OMF 알고리즘의 비볼록 일반화를 제안한다.
  • 마르코프 체인에 대한 약한 혼합 조건 하에서 수렴 분석을 도입하여 기대 손실의 임계점으로 거의 확실히 수렴함을 보장한다.
  • 최근의 MCMC 알고리즘과 온라인 비음수 행렬 분해(ONMF)를 조합하여 복잡한 네트워크에서 네트워크 모티프를 샘플링한다.
  • MCMC로 생성된 모티프 스트림을 OMF 알고리즘의 입력으로 사용하여 온라인 방식으로 네트워크 모티프의 딕셔너리를 학습한다.
  • 비볼록성 하에서도 수렴을 유지하기 위해 제약 집합과 타원형 탍가능 영역을 사용한 투영 경사하강 업데이트 규칙을 구현한다.
  • 부분수열 수렴 논증과 정규근사 분석을 활용하여 반복의 극한점이 목적 함수의 임계점임을 증명한다.

실험 결과

연구 질문

  • RQ1데이터가 i.i.d.가 아니라 종속된 경우 온라인 행렬 분해가 임계점으로 수렴할 수 있는가?
  • RQ2약한 혼합 조건을 만족하는 마르코프 데이터 모델 하에서 OMF의 수렴이 유지되는가?
  • RQ3제안된 OMF 프레임워크는 네트워크 데이터로부터 의미 있는 국소 패턴을 효과적으로 추출할 수 있는가?
  • RQ4독립성을 확보하기 위해 표본 추출 없이 온라인 스트리밍 방식으로 네트워크 딕셔너리의 모티프를 학습할 수 있는가?
  • RQ5제안된 네트워크 딕셔너리 학습 프레임워크의 수렴에 대해 어떤 이론적 보장을 확보할 수 있는가?

주요 결과

  • 제안된 OMF 알고리즘은 약한 혼합 조건을 만족하는 마르코프 체인으로부터 생성된 데이터일지라도 기대 손실 함수의 임계점 집합으로 거의 확실히 수렴한다.
  • 표본 추출 없이도 수렴 결과가 유지되어 자연스럽게 종속된 데이터 스트림으로부터 더 효율적인 특징 추출이 가능하다.
  • 이 방법은 새로운 네트워크 딕셔너리 학습(NDL) 프레임워크를 통해 온라인 방식으로 지역 하위그래프 패턴(모티프)을 학습하는 데 응용된다.
  • NDL 프레임워크는 실세계 네트워크 데이터에서 효과적인 네트워크 노이즈 제거를 달성하여 실용적 유용성을 입증한다.
  • NDL 알고리즘의 수렴 보장은 주요 이론적 결과의 따름정리(따름정리 6.1)로서 확립된다.
  • 이 프레임워크는 이징 스핀 구성과 실세계 네트워크에서 검증되었으며, 상관관계가 있는 데이터를 다룰 때 강건성과 효율성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.