Skip to main content
QUICK REVIEW

[论文解读] DSTC8-AVSD: Multimodal Semantic Transformer Network with Retrieval Style Word Generator

Hwanhee Lee, Seunghyun Yoon|arXiv (Cornell University)|Apr 1, 2020
Multimodal Machine Learning Applications参考文献 16被引用 14
一句话总结

该论文提出了一种用于视听场景感知对话(AVSD)的多模态语义Transformer网络(MSTN),通过用检索式词嵌入注意力机制替代标准的线性解码器输出层,提升生成响应的语义相关性。该模型在DSTC8上表现优于先前方法,在BLEU-4、METEOR、ROUGE-L和CIDEr指标上均达到当前最优结果,通过在解码过程中显式关注词义实现。

ABSTRACT

Audio Visual Scene-aware Dialog (AVSD) is the task of generating a response for a question with a given scene, video, audio, and the history of previous turns in the dialog. Existing systems for this task employ the transformers or recurrent neural network-based architecture with the encoder-decoder framework. Even though these techniques show superior performance for this task, they have significant limitations: the model easily overfits only to memorize the grammatical patterns; the model follows the prior distribution of the vocabularies in a dataset. To alleviate the problems, we propose a Multimodal Semantic Transformer Network. It employs a transformer-based architecture with an attention-based word embedding layer that generates words by querying word embeddings. With this design, our model keeps considering the meaning of the words at the generation stage. The empirical results demonstrate the superiority of our proposed model that outperforms most of the previous works for the AVSD task.

研究动机与目标

  • 解决序列到序列模型在AVSD中过度拟合语法模式和先验词汇分布的问题。
  • 通过在解码过程中引入意义感知的词选择机制,提升生成响应的语义相关性。
  • 设计一种解码器,能够基于语义嵌入动态检索词语,而非依赖固定的线性投影。
  • 评估在结合视频、音频、文本和对话历史的多模态上下文中,检索式词生成器的有效性。
  • 通过简化但高效的基于Transformer的架构,在DSTC8-AVSD基准上实现最先进性能。

提出的方法

  • 该模型采用基于Transformer的编码器-解码器框架,包含五种输入模态:文本、视频(i3d-flow)、音频(veggs)、对话历史和字幕。
  • 编码器通过层归一化、位置编码和前馈网络处理每种模态,并使用模态特定的自注意力机制。
  • 解码器在目标序列上应用多头自注意力,并利用问题作为查询、其他模态作为键/值计算问题感知注意力。
  • 与标准的线性投影层不同,解码器采用词嵌入注意力网络,计算解码器隐藏状态与预训练词嵌入之间的点积得分。
  • 最终的词预测通过在点积得分上应用Softmax得到,使模型能够基于与上下文的语义相似性选择词语。
  • 模型使用Adam优化器进行端到端训练,包含学习率预热步数、Dropout(0.2),以及最大解码长度为30的束搜索(束大小为5)。

实验结果

研究问题

  • RQ1将标准线性解码器输出层替换为检索式词生成器,能否提升AVSD响应生成中的语义相关性?
  • RQ2在解码过程中关注词嵌入,能否减少AVSD模型对语法模式和先验词汇分布的记忆化现象?
  • RQ3所提出的多模态语义Transformer网络(MSTN)在DSTC8-AVSD基准上与现有最先进模型相比表现如何?
  • RQ4检索式词生成器在多模态对话生成中的性能提升中起到了多大程度的贡献?
  • RQ5一种简化版的Transformer架构结合基于注意力的词生成,能否在不使用自编码器损失的情况下超越更复杂的模型(如MTN)?

主要发现

  • 所提出的MSTN模型在DSTC8-AVSD基准上达到最先进性能,优于所有基线模型,包括MTN和师生蒸馏模型。
  • 在DSTC8(6个参考句)测试集上,MSTN取得BLEU-4为0.385、METEOR为0.270、ROUGE-L为0.564、CIDEr为1.073,显著超越次优模型。
  • 消融实验表明,移除检索式词生成器(MSTN w/o WEAN)会导致性能下降,证实其关键贡献——例如,BLEU-4从0.385降至0.367。
  • 该模型在多个指标上均保持强劲表现,表明生成响应的语义对齐性和流畅性得到提升。
  • 即使不使用GloVe等预训练嵌入,模型仍表现良好,表明通过注意力机制学习的词嵌入已足够且有效。
  • 结果表明,基于注意力的词生成显著增强了解码过程中的语义理解,降低了对记忆化模式的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。