Skip to main content
QUICK REVIEW

[论文解读] A survey on Self Supervised learning approaches for improving Multimodal representation learning

Naman Goyal|arXiv (Cornell University)|Oct 20, 2022
Text and Document Classification Technologies被引用 5
一句话总结

本综述介绍了四种自监督学习方法——跨模态生成、跨模态预训练、循环翻译以及自监督单模态标签生成,以提升多模态表征学习。通过利用数据结构作为监督信号,这些方法在无需人工标注标签的情况下增强了联合表征,从而在多模态情感分析等任务中实现了稳健的性能。

ABSTRACT

Recently self supervised learning has seen explosive growth and use in variety of machine learning tasks because of its ability to avoid the cost of annotating large-scale datasets. This paper gives an overview for best self supervised learning approaches for multimodal learning. The presented approaches have been aggregated by extensive study of the literature and tackle the application of self supervised learning in different ways. The approaches discussed are cross modal generation, cross modal pretraining, cyclic translation, and generating unimodal labels in self supervised fashion.

研究动机与目标

  • 为解决多模态表征学习中有限标注多模态数据的挑战。
  • 探索从数据结构而非人工标注中生成监督信号的自监督学习技术。
  • 通过整合从多模态数据中衍生的单模态监督,改进多模态表征学习。
  • 评估自监督方法在学习稳健联合多模态表征方面对下游任务的有效性。
  • 全面概述当前最先进的自监督多模态学习方法,重点聚焦于表征学习。

提出的方法

  • 通过图像到文本和文本到图像的生成模型进行跨模态生成,以生成具有语境关联的局部表征。
  • 采用双分支架构,结合高层抽象特征与低层具身特征,以提升模态间对齐。
  • 利用序列到序列网络在模态之间(如语言→视觉→音频)进行循环翻译,以学习联合表征。
  • 引入非参数化的单模态标签生成模块,基于样本与类别中心的相对距离来估计单模态标签。
  • 采用多任务学习并结合加权损失策略,联合优化多模态与自监督单模态预测头。
  • 端到端训练,采用耦合的翻译-预测损失,结合循环翻译与特定任务的预测目标。

实验结果

研究问题

  • RQ1自监督学习如何在不依赖昂贵人工标注的情况下提升多模态表征学习?
  • RQ2跨模态生成在多大程度上能增强图像与文本表征之间的对齐与具身性?
  • RQ3与标准预训练相比,模态间的循环翻译是否能产生更鲁棒的联合表征?
  • RQ4自监督生成的单模态标签在多模态模型性能提升方面有多有效?
  • RQ5结合自监督单模态监督的多任务学习对下游任务准确率有何影响?

主要发现

  • 结合具身特征与抽象特征的跨模态生成,通过对齐局部与全局表征,提升了检索性能。
  • 模态间的循环翻译实现了端到端的联合表征学习,能够最大程度地捕捉所有模态的信息。
  • 基于类别中心相对距离的自监督单模态标签生成,产生了有意义的监督信号,提升了模型泛化能力。
  • 采用平衡损失权重的多任务训练,提升了多模态与单模态头的学习效率与整体性能。
  • 所提出方法在多模态情感分析任务中表现优异,推理时仅需输入源模态数据。
  • 该框架展现出强鲁棒性与可迁移性,尤其在人工标注数据稀缺的低资源场景下表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。