[论文解读] Multimodal Representation Learning using Deep Multiset Canonical Correlation
该论文提出深度多集典型相关分析(dMCCA),一种深度学习框架,通过学习非线性变换至共享子空间,将典型相关分析扩展到多模态,以最大化模态间与模态内协方差比。该方法在噪声手写数字分类任务中优于基于CCA的方法,并与端到端深度学习模型性能相当,展现出对噪声的鲁棒性以及在无类别标签情况下的有效多模态表征学习能力。
We propose Deep Multiset Canonical Correlation Analysis (dMCCA) as an extension to representation learning using CCA when the underlying signal is observed across multiple (more than two) modalities. We use deep learning framework to learn non-linear transformations from different modalities to a shared subspace such that the representations maximize the ratio of between- and within-modality covariance of the observations. Unlike linear discriminant analysis, we do not need class information to learn these representations, and we show that this model can be trained for complex data using mini-batches. Using synthetic data experiments, we show that dMCCA can effectively recover the common signal across the different modalities corrupted by multiplicative and additive noise. We also analyze the sensitivity of our model to recover the correlated components with respect to mini-batch size and dimension of the embeddings. Performance evaluation on noisy handwritten datasets shows that our model outperforms other CCA-based approaches and is comparable to deep neural network models trained end-to-end on this dataset.
研究动机与目标
- 为解决传统CCA和DCCA仅限于两模态的局限性,将其扩展至多模态(N > 2)。
- 开发一种基于深度学习的方法,以在无需类别标签的情况下捕捉多模态间的非线性关系。
- 通过小批量随机训练实现可扩展性,适用于大规模复杂数据集。
- 通过联合优化模态间与模态内协方差,提升表征学习效果,增强可靠性与泛化能力。
- 在合成数据和真实世界噪声数据集(如n-MNIST)上展示dMCCA的有效性,性能可与监督模型相媲美。
提出的方法
- dMCCA使用深度神经网络学习从N个模态到共享低维嵌入空间的非线性变换。
- 损失函数通过最大化模态间协方差与模态内协方差的比值来优化,类似于测试-重测可靠性中的可靠性度量。
- 该方法采用小批量随机梯度下降,以实现大规模数据集上的可扩展训练。
- 通过重构损失保留信号保真度,并利用亲和度度量评估模态间的相关性。
- 框架通过反向传播进行端到端训练,梯度来源于协方差矩阵的奇异值。
- 通过亲和度指标评估模型:集合内亲和度(Ra)用于衡量重构质量,集合间亲和度(Rs)用于衡量模态相关性。
实验结果
研究问题
- RQ1能否通过最大化协方差比,使深度学习框架在多于两模态之间有效学习共享表征?
- RQ2在噪声真实世界多模态数据上,dMCCA相较于监督和无监督基线方法表现如何?
- RQ3在表征质量方面,dMCCA对小批量大小和嵌入维度的敏感性如何?
- RQ4dMCCA是否在捕捉非线性共享信号分量方面优于线性与核方法的CCA?
- RQ5dMCCA能否在无需类别标签的情况下实现与端到端监督深度网络相当的性能?
主要发现
- dMCCA在使用tanh激活函数时,集合间亲和度(Rs)达到0.82,显著高于监督基线(0.60),表明学习到的表征中模态相关性更强。
- dMCCA的集合内亲和度(Ra)为0.76,低于监督方法(0.84),但更高的Rs表明共享表征质量更优。
- 在合成数据上,性能在嵌入维度K=10时稳定,与数据生成过程中使用的真正相关分量数量一致。
- 在n-MNIST数据集上,当K>40时,dMCCA准确率达到87%,优于线性MCCA和DCCA,且与端到端监督DNN无统计学差异。
- 对dMCCA嵌入进行聚类,NMI为0.72,完整性为0.67,表明其在无监督学习中具有良好的线性可分性。
- 当小批量大小大于400时,模型表现一致,证实了随机优化中的稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。