Skip to main content
QUICK REVIEW

[논문 리뷰] Missing Not at Random in Matrix Completion: The Effectiveness of Estimating Missingness Probabilities Under a Low Nuclear Norm Assumption

Wei Ma, George H. Chen|arXiv (Cornell University)|2019. 10. 28.
Sparse and Compressive Sensing Techniques인용 수 21
한 줄 요약

이 논문은 누락되지 않은 값이 관측되지 않은 값과 체계적으로 연관되어 있는 Missing Not at at Random (MNAR) 설정에서, 누락 패턴의 낮은 핵자명수 구조를 활용하여 누락 확률을 추정하는 새로운 방법을 제안한다. 이중 누락 마스크에 1bitMC(핵자명수 제약이 있는 행렬 완성)를 적용함으로써, 강한 파rametric 가정 없이 정확한 경향 점수 추정을 달성하며, 로지스틱 회귀 및 나이브 베이즈 기반 방법에 비해 후행 행렬 완성 정확도를 크게 향상시킨다.

ABSTRACT

Matrix completion is often applied to data with entries missing not at random (MNAR). For example, consider a recommendation system where users tend to only reveal ratings for items they like. In this case, a matrix completion method that relies on entries being revealed at uniformly sampled row and column indices can yield overly optimistic predictions of unseen user ratings. Recently, various papers have shown that we can reduce this bias in MNAR matrix completion if we know the probabilities of different matrix entries being missing. These probabilities are typically modeled using logistic regression or naive Bayes, which make strong assumptions and lack guarantees on the accuracy of the estimated probabilities. In this paper, we suggest a simple approach to estimating these probabilities that avoids these shortcomings. Our approach follows from the observation that missingness patterns in real data often exhibit low nuclear norm structure. We can then estimate the missingness probabilities by feeding the (always fully-observed) binary matrix specifying which entries are revealed or missing to an existing nuclear-norm-constrained matrix completion algorithm by Davenport et al. [2014]. Thus, we tackle MNAR matrix completion by solving a different matrix completion problem first that recovers missingness probabilities. We establish finite-sample error bounds for how accurate these probability estimates are and how well these estimates debias standard matrix completion losses for the original matrix to be completed. Our experiments show that the proposed debiasing strategy can improve a variety of existing matrix completion algorithms, and achieves downstream matrix completion accuracy at least as good as logistic regression and naive Bayes debiasing baselines that require additional auxiliary information.

연구 동기 및 목표

  • 관측되지 않은 값과 체계적으로 연관된 누락 항목이 존재하는 Missing Not at at Random (MNAR) 설정에서 편향이 발생하는 행렬 완성 문제를 해결하기 위해.
  • 이전 연구에서 사용하는 강한 파arametric 가정을 피하는 경향 점수(누락 확률) 추정 방법을 개발하기 위해.
  • 추정된 누락 확률에 대한 유한 표본 오차 경계와 그 후행 행렬 완성 성능에 미치는 영향을 이론적으로 확립하기 위해.
  • 다양한 알고리즘과 데이터셋에서 제안된 방법이 행렬 완성 정확도를 향상시킨다는 것을 경험적으로 입증하기 위해.
  • 보조 정보가 필요 없는 기존의 로지스틱 회귀나 나이브 베이즈와 같은 기준 방법과 경쟁하거나 슈퍼어리어하거나 하는가를 보여주기 위해.

제안 방법

  • 이 방법은 누락 패턴을 이진 행렬 M으로 간주하며, M_{u,i} = 1일 경우 항목 (u,i)가 관측되었음을 의미하고, 0일 경우 관측되지 않았음을 의미한다.
  • Davenport 등(2014)이 제안한 1비트 행렬 완성(1bitMC) 알고리즘을 M에 적용하여, 기저 누락 확률 행렬 P의 저질서 추정치를 회복한다. 이는 핵자명수 제약이 있는 행렬 완성을 통해 수행된다.
  • 회복된 P는 역확률 가중치를 통한 표준 행렬 완성 알고리즘의 편향을 줄이기 위해 사용되며, MNAR 누락성의 영향을 감소시킨다.
  • 이론적 분석을 통해 P의 추정 오차 및 후행 행렬 완성에서의 편향 감소에 대한 유한 표본 오차 경계를 확립한다.
  • 이 방법은 진정한 누락 확률 행렬 P가 낮은 핵자명수를 가진다는 가정에 기반하며, Coat 및 MovieLens-100k와 같은 실제 데이터셋에서 이 가정이 경험적으로 검증된다.
  • 이 방법은 후행 행렬 완성 알고리즘에 관계없이 적용 가능하므로, PMF, SVD, SoftImpute 등에 적용 가능한 플러그인 편향 제거 전략이다.

실험 결과

연구 질문

  • RQ1로지스틱 회귀나 나이브 베이즈와 같이 강한 파arametric 모델에 의존하지 않고, MNAR 행렬 완성에서 누락 확률을 정확히 추정할 수 있는가?
  • RQ2누락 패턴의 낮은 핵자명수 구조를 활용하면 전통적인 파arametric 모델보다 더 나은 경향 점수 추정 성능을 달성할 수 있는가?
  • RQ3추정된 누락 확률의 오차는 후행 행렬 완성 정확도에 어떤 영향을 미치는가?
  • RQ4제안된 방법은 다양한 알고리즘과 실제 세계 데이터셋에서 행렬 완성 성능을 향상시킬 수 있는가?
  • RQ5보조 정보가 필요 없는 제안된 방법은 기존의 보조 정보가 필요한 편향 제거 기준 방법과 경쟁하거나 슈퍼어리어한 성능을 낼 수 있는가?

주요 결과

  • 1bitMC 기반의 누락 확률 추정은 로지스틱 회귀나 나이브 베이즈 기반 방법과 동일하거나 그 이상의 행렬 완성 정확도를 달성하며, 이는 추가적인 보조 정보가 필요하지 않다.
  • MovieLens-100k 및 Coat 데이터셋에서 1bitMC-PMF 및 1bitMC-SVD++ 버전은 각각 MAE 값 0.718 ± 0.004를 기록하며, PMF 및 SVD++ 기반 방법을 능가한다.
  • 합성 데이터 실험에서 1bitMC-PMF는 UserItemData에서 MAE 0.308 ± 0.002를 기록하여 LR-PMF와 동일한 성능을 보이며, PMF 및 SVD보다 뛰어난 성능을 보였다.
  • 이 방법은 누락 확률 추정 및 후행 행렬 완성에 대해 모두 유한 표본 오차 경계를 확보하여 이론적 보장을 제공한다.
  • Coat 및 MovieLens-100k의 누락 마스크 행렬은 저질서 블록 구조를 보이며, 이는 낮은 핵자명수 가정을 지지하고 방법의 설계 선택을 정당화한다.
  • 이 방법은 PMF, SVD, SoftImpute, MaxNorm, WTN 등 여러 행렬 완성 알고리즘에 일반화되며, 일관되게 기준 성능을 향상시키거나 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.