Skip to main content
QUICK REVIEW

[논문 리뷰] LMLFM: Longitudinal Multi-Level Factorization Machine

Junjie Liang, Dongkuan Xu|arXiv (Cornell University)|2019. 11. 11.
Recommender Systems and Techniques참고 문헌 34인용 수 4
한 줄 요약

LMLFM는 복잡한 상관 구조(종단적 및 군집 상관)를 가진 고차원 종단적 데이터에서 고정 효과와 반복 효과를 동시에 선택하는 새로운 종단적 다수준 인수분해 기계이다. 계층적 베이지안 프레임워크와 이중 레이어의 라플라스 사전분포, 반복 조건 모드 최적화를 사용하여, 최신 기법들에 비해 예측 정확도, 희박성, 확장성 측면에서 뛰어난 성능을 보였다. 이는 5,000개 이상의 변수를 가진 시뮬레이션 및 실세계 데이터에서 입증되었다.

ABSTRACT

We consider the problem of learning predictive models from longitudinal data, consisting of irregularly repeated, sparse observations from a set of individuals over time. Such data often exhibit {\em longitudinal correlation} (LC) (correlations among observations for each individual over time), {\em cluster correlation} (CC) (correlations among individuals that have similar characteristics), or both. These correlations are often accounted for using {\em mixed effects models} that include {\em fixed effects} and {\em random effects}, where the fixed effects capture the regression parameters that are shared by all individuals, whereas random effects capture those parameters that vary across individuals. However, the current state-of-the-art methods are unable to select the most predictive fixed effects and random effects from a large number of variables, while accounting for complex correlation structure in the data and non-linear interactions among the variables. We propose Longitudinal Multi-Level Factorization Machine (LMLFM), to the best of our knowledge, the first model to address these challenges in learning predictive models from longitudinal data. We establish the convergence properties, and analyze the computational complexity, of LMLFM. We present results of experiments with both simulated and real-world longitudinal data which show that LMLFM outperforms the state-of-the-art methods in terms of predictive accuracy, variable selection ability, and scalability to data with large number of variables. The code and supplemental material is available at \url{https://github.com/junjieliang672/LMLFM}.

연구 동기 및 목표

  • 사전에 고정 효과와 반복 효과가 명시되지 않은 고차원 종단적 데이터에서 예측 모델을 학습하는 데 도전하는 것.
  • 종단적 상관(LC)과 군집 상관(CC)을 포함한 복잡한 상관 구조를 고려하면서 고정 효과와 반복 효과를 동시에 선택하는 것.
  • 초모수 조정에 대한 의존도를 줄이고 변수 수가 많은 데이터에서의 확장성을 향상시키는 것.
  • 종단적 환경에서 비선형 상호작용과 희박하고 해석 가능한 표현을 효과적으로 모델링하는 것.
  • 기존 혼합 효과 모델의 확장성이 변수 수에 비례해 떨어지는 데 비해, 증명 가능하게 수렴하고 계산적으로 효율적인 대안을 제공하는 것.

제안 방법

  • LMLFM는 두 층의 라플라스 사전분포를 사용한 계층적 베이지안 공식화를 통해 인수분해 기계(FM)를 종단적 데이터로 확장한다.
  • 첫 번째 라플라스 사전분포는 잠재 요인 표현의 희박성을 유도하여 고차원 데이터에서의 효율적 학습을 가능하게 한다.
  • 두 번째 라플라스 사전분포는 고정 효과(모든 개인에게 공통)와 반복 효과(개인 또는 군집별로 다름)를 구분함으로써 자동으로 효과 선택이 가능하다.
  • 모델은 반복 조건 모드(ICM) 알고리즘을 사용해 훈련되며, 이는 강력한 수렴 보장과 계산 효율성을 보장한다.
  • LMLFM는 개인 수준 및 그룹 수준의 영향을 통합된 확률적 프레임워크 내에서 통합함으로써 비선형 상호작용과 상관 구조(LC 및 CC)를 동시에 모델링한다.
  • 이 프레임워크는 초모수 조정을 최소화하면서도 자동 변수 선택을 가능하게 하여 모델의 해석 가능성과 확장성을 향상시킨다.

실험 결과

연구 질문

  • RQ1통합된 모델이 고차원 종단적 데이터에서 복잡한 상관 구조를 고려하면서 고정 효과와 반복 효과를 동시에 선택할 수 있는가?
  • RQ2LMLFM는 시뮬레이션 및 실세계 종단적 데이터에서 최신 기준 모델들에 비해 예측 정확도와 변수 선택 성능에서 어떻게 성과를 내는가?
  • RQ3기존 혼합 효과 모델이 실패하는 5,000개 이상의 변수를 가진 데이터셋에 대해 LMLFM는 얼마나 잘 확장되는가?
  • RQ4LMLFM는 실세계 데이터에서 종단적 상관(LC)과 군집 상관(CC)의 존재와 지배성을 효과적으로 식별할 수 있는가?
  • RQ5LMLFM는 건강 및 사회과학 분야의 도메인 전문 지식에 부합하는 희박하고 해석 가능한 모델을 생성할 수 있는가?

주요 결과

  • LMLFM는 변수 수가 5,000개가 넘는 종단적 데이터를 성공적으로 모델링했으며, 기존 혼합 효과 모델은 변수 수가 100개를 초과하면 성능을 유지하지 못했다.
  • 1,553개의 변수를 가진 GSS 데이터셋에서 LMLFM는 모든 기준 모델 중 가장 높은 R² 점수를 기록했으며, FM, MLLASSO, RF에 비해 예측 정확도에서 뚜렷한 우위를 보였다.
  • 1,199개의 변수 중에서 LMLFM는 고정 효과로 126개의 비영향 요소를 식별했으며, 절댓값이 0.1 초과인 변수는 단 6개에 불과하여 높은 희박성과 효과적인 변수 선택을 보였다.
  • GSS 데이터에서 반복 효과 행렬 Θ^O의 희박률은 84.9%였으며, 이는 군집 상관(CC)이 종단적 상관(LC)보다 지배적임을 시사한다.
  • LMLFM가 선택한 변수들은 결혼, 건강, 재정 만족도, 종교심 등 행복 예측 요인에 대한 기존 연구 결과와 일치하였다.
  • GSS 데이터에서 LMLFM는 종단적 상관(LC)이 존재하지 않음을 규명했으며, 이는 설문 조사 간격이 길었기 때문일 가능성이 높고, 군집 상관(CC)이 지배적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.