Skip to main content
QUICK REVIEW

[论文解读] Tutorial on principal component analysis, with applications in R

Henk van Elst|arXiv (Cornell University)|Jan 1, 2021
Spectroscopy and Chemometric Analyses被引用 1
一句话总结

本教程通过R语言提供了主成分分析(PCA)的全面、以代码为导向的入门教学,展示了对女性身高、体重和年龄三元数据集进行数据标准化、相关系数矩阵的特征值分解以及降维处理。关键结果表明,单一主成分即可解释总方差的57.94%,将原始三维数据降维为具有最大解释方差的单变量表示,并在变量之间呈现完全负相关的特征。

ABSTRACT

This tutorial reviews the main steps of the principal component analysis of a multivariate data set and its subsequent dimensional reduction on the grounds of identified dominant principal components. The underlying computations are demonstrated and performed by means of a script written in the statistical software package R.

研究动机与目标

  • 通过R编程语言提供一种清晰、可复现的主成分分析(PCA)教学教程。
  • 在成年女性身高、体重和年龄的真实多变量数据集上,演示PCA的实际应用。
  • 说明通过样本相关系数矩阵的特征值分解,如何实现有效的降维。
  • 展示如何在原始尺度和变换后尺度下对标准化数据和重构数据进行可视化与解释。
  • 通过透明、可执行的R代码和可视化,支持研究人员和学生理解PCA。

提出的方法

  • 从Howell(2001)的数据集中加载并筛选出187名女性的真实数据,提取三个度量变量:身高[cm]、体重[kg]和年龄[yr]。
  • 进行描述性统计分析,并通过三维散点图和散点图矩阵可视化数据,以评估分布情况和两两关系。
  • 使用R语言的scale()函数对数据进行z得分标准化,确保PCA中各变量权重相等。
  • 计算样本相关系数矩阵并执行特征值分解,以识别主成分。
  • 根据方差解释比例选择主导主成分,并构建降维后的数据集。
  • 通过反向标准化将降维后的数据重构回原始测量单位,以供解释和比较。

实验结果

研究问题

  • RQ1如何在R语言中对真实多变量数据集逐步实现主成分分析?
  • RQ2在身高、体重和年龄的三元数据集中,第一个主成分解释了总方差的多少比例?
  • RQ3通过PCA进行降维后,变量之间的相关性如何变化?
  • RQ4在多大程度上可从降维后的主成分空间重构原始数据?
  • RQ5在结构和分布方面,原始数据与降维后数据的可视化结果有何异同?

主要发现

  • 第一个主成分单独解释了原始三元数据集中57.94%的总方差。
  • 降维后的数据集在本质上是单变量的,因为第一个主成分解释了大部分变异。
  • 在降维空间中,原始变量之间的两两相关系数均为-1.000,表明存在完全负相关的线性关系。
  • 以原始单位重构的数据(XapproxCor)与原始数据(X)高度接近,重构误差极小。
  • 在标准尺度和原始尺度下对降维数据的可视化显示,尽管进行了降维,其结构模式仍得以保留。
  • 本教程成功演示了从数据加载到可视化与重构的完整可复现的R语言PCA工作流程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。