Skip to main content
QUICK REVIEW

[论文解读] Modality to Modality Translation: An Adversarial Representation Learning and Graph Fusion Network for Multimodal Fusion

Sijie Mai, Haifeng Hu|arXiv (Cornell University)|Nov 18, 2019
Human Pose and Action Recognition参考文献 42被引用 19
一句话总结

本文提出了一种对抗性表示图融合(ARGF)框架,通过对抗性训练学习一种模态不变的嵌入空间,以减少模态差异,随后采用分层图融合网络(GFN)显式建模单模态、双模态和三模态交互。该方法在IEMOCAP和CMU-MOSI数据集上取得了最先进性能,相较于先前方法分别提升了超过2%和1%。

ABSTRACT

Learning joint embedding space for various modalities is of vital importance for multimodal fusion. Mainstream modality fusion approaches fail to achieve this goal, leaving a modality gap which heavily affects cross-modal fusion. In this paper, we propose a novel adversarial encoder-decoder-classifier framework to learn a modality-invariant embedding space. Since the distributions of various modalities vary in nature, to reduce the modality gap, we translate the distributions of source modalities into that of target modality via their respective encoders using adversarial training. Furthermore, we exert additional constraints on embedding space by introducing reconstruction loss and classification loss. Then we fuse the encoded representations using hierarchical graph neural network which explicitly explores unimodal, bimodal and trimodal interactions in multi-stage. Our method achieves state-of-the-art performance on multiple datasets. Visualization of the learned embeddings suggests that the joint embedding space learned by our method is discriminative. code is available at: \url{https://github.com/TmacMai/ARGF_multimodal_fusion}

研究动机与目标

  • 解决多模态融合中由于模态间分布异质性导致的模态差异问题。
  • 学习一种联合的、模态不变的嵌入空间,以增强跨模态兼容性与表示判别能力。
  • 通过结构化的图融合机制,显式建模分层的跨模态交互——单模态、双模态与三模态交互。
  • 通过对抗性分布匹配、重建损失与分类损失,提升多模态融合性能。

提出的方法

  • 采用对抗性编码器-解码器-分类器框架,通过判别性训练将源模态分布与目标模态分布对齐。
  • 应用对抗性训练,使源模态的编码器被优化以欺骗判别器,使其将这些表示分类为真实(目标模态)样本。
  • 引入模态特定的解码器以重建原始输入特征,在嵌入学习过程中保留单模态信息。
  • 实现分类器头,确保学习到的嵌入空间对下游任务具有判别性。
  • 采用具有三层结构的分层图融合网络(GFN):单模态、双模态与三模态节点,实现对跨模态动态的结构化融合。
  • 为图边分配可学习权重,实现对不同类型交互的动态重要性分配,并支持可解释的融合过程。

实验结果

研究问题

  • RQ1对抗性训练能否通过对齐异质模态分布,有效减少模态差异?
  • RQ2联合嵌入学习结合重建损失与分类损失,如何提升多模态融合中的表示质量?
  • RQ3分层图融合网络能否显式建模并提升单模态、双模态与三模态交互?
  • RQ4所提出的框架是否在多模态情感分析任务中优于现有融合策略?
  • RQ5通过可视化,所学习的嵌入空间在判别性与可解释性方面达到何种程度?

主要发现

  • ARGF在IEMOCAP和CMU-MOSI数据集上取得了最先进性能,相较于先前方法在准确率上分别提升了超过2%和1%。
  • 所学习嵌入空间的可视化显示,正面与负面情感类别形成清晰且分离良好的聚类,表明其具有高度判别能力。
  • 缺乏分类器的嵌入空间无法有效区分情感类别,证明了分类损失在判别性学习中的必要性。
  • 图融合可视化显示,在单模态融合中语言模态最具预测性,但当语言模态存在歧义时,其他模态则成为主导因素。
  • 双模态融合中,语音-语言与视觉-语言交互的权重较高,表明其对情感预测有显著贡献。
  • 三模态融合主要由两个双模态节点的融合主导,凸显了建模双模态交互对的重要性,而DFG未能捕捉此类交互。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。