Skip to main content
QUICK REVIEW

[论文解读] Additive Non-negative Matrix Factorization for Missing Data

Mithun Das Gupta|arXiv (Cornell University)|Jul 1, 2010
Face and Expression Recognition参考文献 13被引用 5
一句话总结

该论文提出了一种加法非负矩阵分解(ANMF)方法,通过从训练数据中学习一个过完备字典,联合优化缺失属性的估计值与因子权重,以填补多变量数据集中的缺失数据。该方法在高缺失率下相比零值、均值或随机填补法,均展现出更优的分类准确率,并具备单调收敛性保证。

ABSTRACT

Non-negative matrix factorization (NMF) has previously been shown to be a useful decomposition for multivariate data. We interpret the factorization in a new way and use it to generate missing attributes from test data. We provide a joint optimization scheme for the missing attributes as well as the NMF factors. We prove the monotonic convergence of our algorithms. We present classification results for cases with missing attributes.

研究动机与目标

  • 解决使用非负矩阵分解对缺失属性数据进行分类的挑战。
  • 通过引入加法非负矩阵分解(ANMF)克服标准NMF的局限性,以处理过完备表示(r > d),实现更优的信息编码。
  • 构建一个联合优化框架,同时估计缺失属性并更新NMF因子。
  • 通过辅助函数最小化确保算法的单调收敛性,扩展Lee和Seung的方法。
  • 在真实世界的缺失数据集上,与基线填补方法相比,展示出更优的分类性能。

提出的方法

  • 将ANMF表述为多个非负秩一因子分解之和:$ X = abla_{i=1}^{k} W_i H_i $,以实现重建误差的加法式优化。
  • 通过投影梯度下降方法推导出$ H_j $和$ W_j $的乘法更新规则,确保非负性与收敛性。
  • 引入掩码因子分解方案,将权重矩阵$ W $中的缺失属性置零,并仅使用观测数据优化隐式表示$ extbf{h} $。
  • 利用重构的$ extbf{h} $通过$ x_d = W_d extbf{h} $估计缺失属性,同时在非负最小二乘目标下联合优化$ x_d $与$ extbf{h} $。
  • 通过固定训练数据中学习到的$ W $,仅对测试数据的观测部分优化$ H $,实现高效填补。
  • 通过辅助函数证明平方误差的单调递减性,将Lee和Seung的收敛性证明推广至加法与掩码设定。

实验结果

研究问题

  • RQ1在$ r > d$条件下,加法NMF(ANMF)是否能为缺失数据填补提供优于标准NMF的表征学习能力?
  • RQ2与标准填补策略相比,联合优化缺失属性估计值与因子权重是否能带来更优的分类性能?
  • RQ3尽管NMF问题具有非凸性,所提算法是否能保证单调收敛?
  • RQ4在高缺失率(如30–40%)下,ANMF相较于零值、均值或随机填补法表现如何?
  • RQ5从训练数据中学到的过完备字典是否能有效泛化至测试样本的缺失属性重建?

主要发现

  • 在WDBC数据集上,30%数据缺失(被置零)时,ANMF达到91.91%的分类准确率,显著优于零值填补(86.95%)与均值填补。
  • 在40%缺失数据下,ANMF达到87.61%准确率,远超零值填补(80.35%)与均值填补(64.16%)。
  • 在10%缺失数据下,ANMF达到95.17%准确率,优于零值填补(92.17%)与均值填补(91.30%)。
  • 在Echo数据集上,ANMF在30%缺失数据下保持88.89%准确率,与基线持平,而零值填补下降至77.78%。
  • 该方法在多个数据集(WDBC、Ion、Pima、Echo)上均表现出一致改进,尤其在高缺失率下体现稳健性。
  • 理论分析证明,所提出的更新规则下平方误差非增,确保了单调收敛性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。