Skip to main content
QUICK REVIEW

[论文解读] Tensor Valued Common and Individual Feature Extraction: Multi-dimensional Perspective

Ilia Kisil, Giuseppe G. Calvi|arXiv (Cornell University)|Nov 1, 2017
Tensor decomposition and applications参考文献 19被引用 3
一句话总结

本文提出了一种基于张量的框架,利用CPD和LL1张量分解并施加非负性约束,从多区块数据中提取共性特征与个体特征。通过利用数据的多线性结构,该方法降低了维度并提升了分类准确率——在ORL人脸数据集上使用SVM的分类准确率最高达到94.7%,显著优于原始数据和基于矩阵的方法。

ABSTRACT

A novel method for common and individual feature analysis from exceedingly large-scale data is proposed, in order to ensure the tractability of both the computation and storage and thus mitigate the curse of dimensionality, a major bottleneck in modern data science. This is achieved by making use of the inherent redundancy in so-called multi-block data structures, which represent multiple observations of the same phenomenon taken at different times, angles or recording conditions. Upon providing an intrinsic link between the properties of the outer vector product and extracted features in tensor decompositions (TDs), the proposed common and individual information extraction from multi-block data is performed through imposing physical meaning to otherwise unconstrained factorisation approaches. This is shown to dramatically reduce the dimensionality of search spaces for subsequent classification procedures and to yield greatly enhanced accuracy. Simulations on a multi-class classification task of large-scale extraction of individual features from a collection of partially related real-world images demonstrate the advantages of the "blessing of dimensionality" associated with TDs.

研究动机与目标

  • 通过利用张量结构,解决大规模多区块数据中的维度灾难问题。
  • 利用张量分解从多区块数据中提取具有物理意义的共性与个体特征。
  • 通过低秩张量近似降低数据方差和维度,从而提升分类性能。
  • 通过在因子矩阵上施加非负性约束,确保数学上的可处理性和可解释性。
  • 在真实世界的分类任务中,证明基于张量的特征提取方法相较于传统基于矩阵的方法具有优越性。

提出的方法

  • 该方法使用多线性秩分解(LL1)和CANDECOMP/PARAFAC(CPD)从张量结构数据中分离共性与个体特征子空间。
  • 对模式-3因子矩阵施加非负性约束,以保持物理可解释性,尤其在图像数据中。
  • 该框架利用张量分解中的外积结构,对多个观测之间的共享信息进行建模。
  • 采用交替最小二乘法(ALS)算法,并结合非负最小二乘优化,以强制实现物理约束。
  • 通过将同一主体的图像沿第三维度堆叠,将数据张量化,形成3D张量以实现联合分析。
  • 使用标准模型(SVM、NN、QD、cKNN)对提取的个体特征进行分类,并在原始测试图像上进行评估,以保证公平性。

实验结果

研究问题

  • RQ1如何利用张量分解从多区块数据中有效分离共性与个体特征?
  • RQ2外积在将张量分解与具有物理意义的特征提取相联系中起什么作用?
  • RQ3在因子矩阵上施加非负性如何提升图像特征提取中的可解释性和性能?
  • RQ4与基于矩阵的方法相比,基于张量的特征提取在降低维度和提升分类准确率方面有多大优势?
  • RQ5所提出的方法是否能在不需统一输入维度的前提下,泛化到不同数据结构和分类模型?

主要发现

  • 所提出的方法在使用LL1分解提取的个体特征上,通过SVM实现94.7%的分类准确率,显著优于原始数据的83.9%。
  • 神经网络(NN)的分类准确率从原始数据上的4.35%提升至使用提取个体特征后的92.2%,表明过拟合现象得到缓解。
  • 基于LL1的方法在所有分类器中均取得最高准确率,证明其在提取判别性特征方面的有效性。
  • 非负性约束增强了物理可解释性,并降低了提取特征的方差,从而提升了模型的泛化能力。
  • 该框架可良好泛化至任意阶张量,只要观测沿相同模式连接,即可灵活应用于多种数据类型。
  • 结果证实了张量分解中的“维度之福”现象:高维结构使得特征提取更加高效且准确。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。