Skip to main content
QUICK REVIEW

[论文解读] Improving Visually Grounded Sentence Representations with Self-Attention

Kang Min Yoo, Youhyun Shin|arXiv (Cornell University)|Dec 2, 2017
Multimodal Machine Learning Applications参考文献 38被引用 6
一句话总结

本文提出一种自注意力增强的编码器,用于视觉对齐的句子表征学习,通过在编码过程中使模型聚焦于视觉显著的词汇,从而提升语言与视觉之间的对齐。实验结果表明,引入自注意力机制显著提升了在迁移任务上的性能,尤其是在结合通用句子表征时,使句子嵌入更具语义和视觉基础。

ABSTRACT

Sentence representation models trained only on language could potentially suffer from the grounding problem. Recent work has shown promising results in improving the qualities of sentence representations by jointly training them with associated image features. However, the grounding capability is limited due to distant connection between input sentences and image features by the design of the architecture. In order to further close the gap, we propose applying self-attention mechanism to the sentence encoder to deepen the grounding effect. Our results on transfer tasks show that self-attentive encoders are better for visual grounding, as they exploit specific words with strong visual associations.

研究动机与目标

  • 通过更深入地整合视觉信号到编码过程中,解决句子表征中的对齐问题。
  • 克服先前模型仅在编码器最终隐藏状态处连接语言与视觉的局限性。
  • 探究句子编码器中引入自注意力机制是否能提升模型识别并强调视觉相关词汇的能力。
  • 通过多模态编码器-解码器框架联合学习语言与视觉,提升通用句子表征的质量。
  • 证明自注意力句子表征在下游自然语言处理迁移任务中能取得更优性能。

提出的方法

  • 以[8]中的Cap2All模型为基础,构建一个多模态编码器-解码器框架,联合预测图像特征和目标字幕,输入为源字幕。
  • 在句子编码器中引入自注意力机制,使模型在编码过程中能动态聚焦于具有强视觉关联的词汇。
  • 使用双向LSTM编码输入字幕,并通过前向和后向隐藏状态的最大池化操作计算句子表征。
  • 将句子表征投影到图像特征空间,并使用log-exp-sum成对排序损失进行训练,以最大化预测图像特征与真实图像特征之间的相似性。
  • 将所得的句子表征与ST-LN(层归一化的跳跃思想)表征拼接,以提升泛化能力。
  • 在COCO5K数据集上以128个样本的mini-batch进行训练,负样本从同一batch中采样。

实验结果

研究问题

  • RQ1句子编码器中的自注意力机制能否提升视觉对齐句子表征的质量?
  • RQ2模型对视觉显著词汇的关注能力是否能带来下游自然语言处理迁移任务性能的提升?
  • RQ3与标准LSTM编码器相比,自注意力编码器在视觉对齐和迁移性能方面表现如何?
  • RQ4自注意力机制在多大程度上帮助模型识别并强调具有强视觉关联的词汇?
  • RQ5自注意力能否在无需任务特定微调的情况下增强句子嵌入的表征能力?

主要发现

  • 自注意力机制显著提升了句子表征质量,在8项迁移任务中的5项上取得性能增益,尤其当与ST-LN嵌入结合时。
  • Att. Cap2All模型在MRPC任务上取得81.88的F1分数,优于基线模型Cap2All(82.26),在SST任务上准确率提升至83.03,高于基线模型的81.16。
  • 在SICK相关性任务上,自注意力模型取得84.54的皮尔逊相关系数,略高于基线模型Cap2All的84.37。
  • 注意力可视化结果证实,模型学会了关注如'man'(男人)、'black'(黑色)、'guitar'(吉他)、'cat'(猫)和'bowl'(碗)等视觉显著词汇,表明在词级别实现了有效的视觉对齐。
  • 尽管在CR、MPQA和MRPC任务上出现部分性能下降,但整体趋势显示持续改进,表明自注意力机制增强了表征的丰富性。
  • 该模型在图像和字幕检索任务上取得了具有竞争力的性能,与专用方法相当,尽管是端到端在统一目标下进行训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。