[论文解读] ATD: Augmenting CP Tensor Decomposition by Self Supervision
本文提出增强张量分解(ATD),一种自监督方法,通过整合数据增强和对比学习,提升CP张量分解的性能,从而提高下游分类准确率。通过将Frobenius范数拟合与自监督对比损失相结合,形成联合目标函数,ATD在张量基线模型上实现最高2.5%的准确率提升,在自监督和自编码器模型上最高提升15%,同时参数量不足深度学习基线模型的5%。
Tensor decompositions are powerful tools for dimensionality reduction and feature interpretation of multidimensional data such as signals. Existing tensor decomposition objectives (e.g., Frobenius norm) are designed for fitting raw data under statistical assumptions, which may not align with downstream classification tasks. In practice, raw input tensor can contain irrelevant information while data augmentation techniques may be used to smooth out class-irrelevant noise in samples. This paper addresses the above challenges by proposing augmented tensor decomposition (ATD), which effectively incorporates data augmentations and self-supervised learning (SSL) to boost downstream classification. To address the non-convexity of the new augmented objective, we develop an iterative method that enables the optimization to follow an alternating least squares (ALS) fashion. We evaluate our proposed ATD on multiple datasets. It can achieve 0.8% ~ 2.5% accuracy gain over tensor-based baselines. Also, our ATD model shows comparable or better performance (e.g., up to 15% in accuracy) over self-supervised and autoencoder baselines while using less than 5% of learnable parameters of these baseline models.
研究动机与目标
- 解决传统张量分解目标(基于统计拟合)与下游分类任务之间的对齐偏差问题。
- 将自监督学习(SSL)融入CP张量分解,通过利用数据增强学习类别感知的鲁棒特征。
- 通过最小化可学习参数数量,降低模型复杂度,同时在性能上保持或超越基于深度学习的自监督和自编码器模型。
- 开发一种高效优化方法,在新目标函数非凸性的情况下仍保持CP分解的交替最小二乘法(ALS)结构。
提出的方法
- ATD引入一种混合目标函数,结合标准CP分解损失(Frobenius范数)与基于无偏负样本采样的自监督对比损失。
- 自监督损失通过对比学习框架,强制同一样本的增强视图(正样本对)相似,而不同类别样本(负样本对)不相似。
- 该方法采用迭代优化方案,通过闭式最小二乘法求解每个子问题,保持CP-ALS的计算效率,同时处理非凸的增强目标函数。
- 采用无偏负样本估计以减轻对比自监督中已知的采样偏差问题,提升训练稳定性和泛化能力。
- 该模型学习低秩张量基和对应的系数,形成紧凑且可解释的下游分类特征提取器。
- 该框架设计为可扩展至其他张量模型(如Tucker分解),尽管本文聚焦于CP分解。
实验结果
研究问题
- RQ1自监督学习能否提升CP张量分解在下游分类任务中的性能?
- RQ2如何有效将数据增强整合到张量分解中,以过滤出与类别无关的噪声?
- RQ3能否以一种保持与标准CP-ALS相当计算效率的方式,构建自监督目标?
- RQ4像ATD这样轻量化、低参数量的模型在多大程度上能超越基于深度神经网络的自监督和自编码器模型?
- RQ5所提出方法是否能在显著减少可学习参数数量的前提下,实现优于或相当的性能表现,相比最先进基线模型?
主要发现
- 在多个真实世界数据集上,ATD相较于基于张量的基线模型,准确率提升0.8%至2.5%。
- 平均而言,ATD在分类准确率上相较于自监督和自编码器基线模型最高提升15%,展现出强大的泛化能力。
- 尽管性能显著提升,ATD所用可学习参数量不足基于深度学习的自监督和自编码器模型的5%。
- 迭代优化方法保持了与标准CP-ALS相近的渐近复杂度,确保了可扩展性和效率。
- 该模型在多种数据类型(包括生理信号、高光谱图像和fMRI数据)上表现出鲁棒性,表明其具有广泛适用性。
- 消融研究证实,自监督损失和数据增强组件对性能提升均有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。