Skip to main content
QUICK REVIEW

[논문 리뷰] PCA, SVD, and Centering of Data

Donggun Kim, Kisung You|arXiv (Cornell University)|2023. 07. 27.
Spectroscopy and Chemometric Analyses인용 수 4
한 줄 요약

이 논문은 SVD 기반 주성분 분석에서 데이터 중심화의 영향을 철저히 분석하며, 중심화를 생략할 경우 첫 번째 오른쪽 특이벡터가 평균 방향을 포착하고, 특정 스펙트럼 조건 하에서 결과로 얻는 PCA 임bedding이 진정한 PCA와 약간의 오차로 일치할 수 있음을 보여준다. 주요 기여는 중심화된 및 중심화되지 않은 SVD 기반 PCA 간의 이질성에 대한 이론적 특성화이며, 중심화를 생략함으로써 유도되는 오차에 대한 경계를 제공한다.

ABSTRACT

The research detailed in this paper scrutinizes Principal Component Analysis (PCA), a seminal method employed in statistics and machine learning for the purpose of reducing data dimensionality. Singular Value Decomposition (SVD) is often employed as the primary means for computing PCA, a process that indispensably includes the step of centering - the subtraction of the mean location from the data set. In our study, we delve into a detailed exploration of the influence of this critical yet often ignored or downplayed data centering step. Our research meticulously investigates the conditions under which two PCA embeddings, one derived from SVD with centering and the other without, can be viewed as aligned. As part of this exploration, we analyze the relationship between the first singular vector and the mean direction, subsequently linking this observation to the congruity between two SVDs of centered and uncentered matrices. Furthermore, we explore the potential implications arising from the absence of centering in the context of performing PCA via SVD from a spectral analysis standpoint. Our investigation emphasizes the importance of a comprehensive understanding and acknowledgment of the subtleties involved in the computation of PCA. As such, we believe this paper offers a crucial contribution to the nuanced understanding of this foundational statistical method and stands as a valuable addition to the academic literature in the field of statistics.

연구 동기 및 목표

  • 중심화되지 않은 SVD 기반 PCA가 중심화된 PCA의 임bedding과 일치하는 조건을 조사하는 것.
  • 첫 번째 오른쪽 특이벡터가 데이터의 평균 방향을 어떻게 포착하는지 명확히 하는 것.
  • 중심화를 생략함으로써 발생하는 오차에 대한 스펙트럼 수준의 이론적 경계를 제공하는 것.
  • 일반적으로 사용되는 히우리스틱인 '중심화되지 않은 행렬의 두 번째부터 (k+1)-번째 특이벡터가 중심화된 PCA의 첫 번째 k개 주성분을 근사할 수 있다'는 것을 이론적으로 도전하고 정립하는 것.
  • 특히 고차원 설정에서 SVD 기반 PCA의 알고리즘 기초를 향상시키는 데 기여하는 것.

제안 방법

  • 저자는 중심화된 데이터 행렬 $\bar{X} = X - \mathbf{1}_n \bar{x}^\top$ 과 중심화되지 않은 행렬 $X$ 의 SVD 를 비교하여 그 특이벡터와 특이값을 분석한다.
  • 행렬 $X$ 와 $\bar{X}$ 의 제곱 특이값의 부분합 간의 스펙트럼 경계를 유도하며, $\|X\|_{2,k+1}^2 - (\|\bar{X}\|_{2,k}^2 + n\|\bar{x}\|^2)$ 이 $\bar{\sigma}_1^2$ 으로 유계임을 보인다.
  • 첫 번째 오른쪽 특이벡터와 평균 방향 $\bar{x}$ 간의 관계를 이용하여 SVD와 데이터 중심화 간의 연결 고리를 수립한다.
  • 행렬 섭동 이론과 스펙트럼 분해를 적용하여 중심화된 및 중심화되지 않은 SVD에서 유도된 임bedding 간의 이질성을 특성화한다.
  • 일반적인 가정(예: $p < n$) 하에서 이론적 결과를 도출하였으며, 코로나리언 7 을 통해 저랭크 데이터 행렬로의 확장을 다룬다.
  • 스펙트럼적 해석을 통해 '중심화되지 않은 행렬의 두 번째부터 (k+1)-번째 오른쪽 특이벡터가 중심화된 PCA의 첫 번째 k개 주성분을 근사할 수 있다'는 전통적인 믿음의 이론적 배경을 설명한다.

실험 결과

연구 질문

  • RQ1중심화되지 않은 SVD 기반 PCA에서의 임bedding이 중심화된 SVD 기반 PCA와 약간의 오차로 일치하는 조건은 무엇인가?
  • RQ2중심화되지 않은 데이터 행렬의 첫 번째 오른쪽 특이벡터는 데이터의 평균 방향과 어떻게 관련이 있는가?
  • RQ3중심화된 SVD와 중심화되지 않은 SVD에서 첫 번째 k개 성분이 설명하는 총 분산 간의 이질성에 대한 이론적 경계는 무엇인가?
  • RQ4중심화되지 않은 행렬의 두 번째부터 (k+1)-번째 오른쪽 특이벡터를 사용하여 중심화된 PCA의 첫 번째 k개 주성분을 대체하는 전통적인 히우리스틱은 이론적으로 정당화될 수 있는가?
  • RQ5데이터 행렬의 랭크는 중심화되지 않은 SVD가 진정한 PCA를 얼마나 정확하게 근사하는지에 영향을 미치는가?

주요 결과

  • 중심화되지 않은 SVD와 중심화된 SVD에서 첫 번째 k개 성분이 설명하는 총 분산 간의 이질성은 제6정리에서 보듯이 중심화된 행렬의 가장 큰 특이값의 제곱인 $\bar{\sigma}_1^2$ 으로 유계임을 보였다.
  • 데이터 행렬이 저랭크일 경우에도 이질성은 여전히 $\bar{\sigma}_1^2$ 으로 유계이며, 진짜 랭크에 관계없이 성립함을 코로나리언 7 에서 정식화하였다.
  • 중심화되지 않은 행렬 $X$ 의 첫 번째 오른쪽 특이벡터는 평균 방향 $\bar{x}$ 와 일치하며, 이는 데이터의 전반적인 위치를 포착하기 때문임을 설명한다.
  • 중심화되지 않은 행렬 $X$ 의 SVD 는 중심화된 행렬 $\bar{X}$ 의 SVD 와 스펙트럼적으로 관련이 있으며, 제곱 특이값의 부분합의 차이가 $\bar{\sigma}_1^2$ 로 유계이므로 중심화되지 않은 SVD 가 주성분의 대부분의 구조를 포착하고 있음을 시사한다.
  • 제6정리의 경계는 $\|X\|_{2,k+1}^2 - (\|\bar{X}\|_{2,k}^2 + n\|\bar{x}\|^2)$ 가 $(-\bar{\sigma}_1^2, \bar{\sigma}_1^2)$ 내에 있음을 보여주며, 이는 근사 오차의 정량적 측도를 제공한다.
  • 결과는 제한된 조건 하에서 전통적인 히우리스틱을 검증하며, 중심화되지 않은 행렬의 두 번째부터 (k+1)-번째 오른쪽 특이벡터를 사용하면 중심화된 $\bar{X}$ 의 첫 번째 k개 주성분을 잘 근사할 수 있음을 보여주며, 특히 $\bar{\sigma}_1^2$ 가 총 분산에 비해 작을 경우에 더욱 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.