Skip to main content
QUICK REVIEW

[论文解读] Learning Multimodal Word Representation via Dynamic Fusion Methods

Shaonan Wang, Jiajun Zhang|arXiv (Cornell University)|Jan 2, 2018
Topic Modeling参考文献 24被引用 6
一句话总结

本文提出了三种动态融合方法——模态特定门控(modality-specific gate)、类别特定门控(category-specific gate)和样本特定门控(sample-specific gate)——用于在多模态词表示学习中自适应地学习语言和视觉模态的权重。通过利用词关联对的弱监督信号,模型在六个基准测试上超越了强基线模型(包括单模态和多模态模型),且学习到的权重清晰区分了具体词与抽象词。

ABSTRACT

Multimodal models have been proven to outperform text-based models on learning semantic word representations. Almost all previous multimodal models typically treat the representations from different modalities equally. However, it is obvious that information from different modalities contributes differently to the meaning of words. This motivates us to build a multimodal model that can dynamically fuse the semantic representations from different modalities according to different types of words. To that end, we propose three novel dynamic fusion methods to assign importance weights to each modality, in which weights are learned under the weak supervision of word association pairs. The extensive experiments have demonstrated that the proposed methods outperform strong unimodal baselines and state-of-the-art multimodal models.

研究动机与目标

  • 为了解决现有多模态模型对所有模态一视同仁、不考虑词类别的局限性。
  • 利用词关联对提供的弱监督,学习模态特定的融合权重,以反映语义相似性。
  • 验证假设:具体词更依赖感知(视觉)输入,而抽象词更依赖语言输入。
  • 通过基于词类别的模态或类别动态调整融合权重,提升多模态词表示质量。
  • 为认知理论提供计算证据,即大脑中抽象词与具体词的编码方式不同。

提出的方法

  • 引入三种动态融合机制:模态特定门控(M-gate)、类别特定门控(C-gate)和样本特定门控(S-gate),每种机制均学习语言与视觉模态的注意力权重。
  • 使用词关联对(如 wealthy-rich、jigsaw-puzzle)作为弱监督信号,引导模型学习模态重要性权重。
  • 对每个词,模型通过学习到的门控机制计算语言与视觉表示的加权组合,门控参数通过词对上的对比损失进行优化。
  • 采用模态特定门控为所有词分配单一模态权重;类别特定门控为每个超义类(supersense category)分配权重;样本特定门控为每个词独立分配权重。
  • 利用门控向量的 $l_2$-范数分析学习到的模态重要性,并计算词具体性与模态权重比之间的斯皮尔曼等级相关系数。
  • 采用端到端的对比目标进行训练,确保关联词对具有相似的多模态表示。

实验结果

研究问题

  • RQ1与固定权重融合相比,语言与视觉模态的动态融合是否能提升多模态词表示的质量?
  • RQ2模型是否学习到能反映具体词与抽象词之间认知差异的模态重要性权重?
  • RQ3学习到的模态权重比是否与人类标注的词具体性相关?
  • RQ4不同门控机制(模态特定、类别特定、样本特定)是否导致性能与可解释性上的差异?
  • RQ5仅使用词关联的弱监督,能否有效引导模态融合权重的学习,而无需真实语义向量?

主要发现

  • 所提出的动态融合模型在六个标准基准测试上显著优于强单模态和最先进多模态基线模型。
  • 模态特定门控(M-gate)学习到的语言-视觉权重比为 1.186:0.045,表明语言模态整体占主导地位。
  • 样本特定门控(S-gate)为抽象词分配更高的语言-视觉权重比(3.714:1),高于具体词(2.975:1),显示出对词类别的敏感性。
  • S-gate 模型在词具体性与模态权重比之间实现了 0.614 的斯皮尔曼等级相关系数,支持其认知合理性。
  • 类别特定门控(C-gate)显示,富含抽象语义的类别(如 Cognition、Attribute)的语言-视觉权重比高于富含感知语义的类别(如 Shape、Object)。
  • M-gate 和 C-gate 模型在词具体性与模态权重比之间也表现出较强的皮尔逊相关系数(0.458),证实模型具备学习人类模态偏好能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。