[论文解读] Deep Matching Autoencoders
深度匹配自编码器(DMAE)通过深度自编码器和统计依赖度量(如核目标对齐KTA和平方损失互信息SMI),联合学习共享潜在表征并从无配对的多模态数据中推断对象配对。该方法实现了有效的无监督、半监督和完全监督的跨模态学习,在图像字幕生成任务上达到最先进性能,并在无任何配对数据的情况下,实现了32%准确率的新型无监督分类器学习任务(AwA数据集)。
Increasingly many real world tasks involve data in multiple modalities or views. This has motivated the development of many effective algorithms for learning a common latent space to relate multiple domains. However, most existing cross-view learning algorithms assume access to paired data for training. Their applicability is thus limited as the paired data assumption is often violated in practice: many tasks have only a small subset of data available with pairing annotation, or even no paired data at all. In this paper we introduce Deep Matching Autoencoders (DMAE), which learn a common latent space and pairing from unpaired multi-modal data. Specifically we formulate this as a cross-domain representation learning and object matching problem. We simultaneously optimise parameters of representation learning auto-encoders and the pairing of unpaired multi-modal data. This framework elegantly spans the full regime from fully supervised, semi-supervised, and unsupervised (no paired data) multi-modal learning. We show promising results in image captioning, and on a new task that is uniquely enabled by our methodology: unsupervised classifier learning.
研究动机与目标
- 解决现有跨模态学习方法依赖配对训练数据的局限性,而此类数据在现实应用中往往不可用或稀疏。
- 开发一种深度表征学习框架,能够从无配对数据中联合优化表征学习与跨视图对象匹配。
- 通过统一框架实现从完全监督到无监督的全监督谱系的有效学习。
- 提出并解决一个新任务:无监督分类器学习(UCL),即在不提供图像-类别配对的情况下,从无配对的图像和嵌入池中学习命名类别的分类器。
- 在真实世界视觉与语言数据上展示该方法的可扩展性与有效性,超越以往研究中使用的玩具数据集。
提出的方法
- 为每种模态(如图像和文本)使用一个深度自编码器,通过最小化重构误差学习紧凑且解耦的表征。
- 引入潜在排列矩阵,以建模不同模态中无配对实例之间的未知跨视图配对关系。
- 使用统计依赖度量(核目标对齐KTA和平方损失互信息SMI)优化配对矩阵,以最大化跨模态依赖性。
- 通过反向传播端到端联合训练自编码器与配对矩阵,实现相互提升:更优的表征带来更优的配对,更优的配对又提升表征质量。
- 利用估计的配对矩阵在无监督设置下训练下游分类器(如SVM),从而实现新型无监督分类器学习(UCL)任务。
- 支持多种学习范式:完全监督(完整配对)、半监督(部分配对)和无监督(无配对),采用单一统一架构。
实验结果
研究问题
- RQ1深度神经网络能否从无配对的多模态数据中联合学习有意义的表征并推断对象配对?
- RQ2在无任何配对训练数据的情况下,所提出方法的性能如何?其能否在无监督条件下实现有意义的对齐?
- RQ3与现有方法相比,该方法在半监督和无监督设置下,能多大程度上利用无配对数据来提升性能?
- RQ4该框架能否实现一种新型学习范式——无监督分类器学习,即在无任何图像-类别配对的情况下训练分类器?
- RQ5在跨模态学习任务中,表征与配对的联合优化是否优于分离或顺序处理的方法?
主要发现
- 在AwA数据集上,DMAE-SMI在无初始配对的无监督设置下,估计真实配对矩阵的精确率(precision)达到0.90,召回率(recall)达到0.84。
- 在AwA数据集的无监督分类器学习(UCL)任务中,当未提供任何标注的图像-类别对时,DMAE-SMI实现了32%的测试准确率,显著高于2%的随机基线。
- 在CIFAR-10数据集上,DMAE-SMI在10-40-10半监督设置(10K标注,40K未标注)下达到86%的准确率,优于Deep-MCCA(40%)和MCCA(26%)等基线方法。
- 在归纳半监督设置中,DMAE-SMI相比非归纳基线方法性能最高提升6%,证明了对未配对测试数据的有效利用。
- 该方法在训练迭代过程中表现出配对准确率的单调提升,且DMAE-SMI收敛速度更快、性能更高,优于MCCA和Deep-MCCA等竞争方法。
- 在图像字幕生成基准测试中,DMAE的表现与最先进方法(如DeepCCA和双分支匹配网络)相当,验证了其在监督设置下的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。