[论文解读] Bridging Text and Video: A Universal Multimodal Transformer for Video-Audio Scene-Aware Dialog
本文提出了一种通用多模态变换器,通过多任务学习微调预训练的 GPT-2 模型,联合编码视频、音频、字幕和对话历史,以实现场景感知对话生成。通过将文本、视频和音频特征整合到统一序列中,并在响应语言建模、视频-音频序列建模和字幕语言建模上进行训练,该方法在 DSTC8-AVSD 基准测试中取得了最先进性能,在自动评估和人工评估中均优于先前模型。
Audio-Visual Scene-Aware Dialog (AVSD) is a task to generate responses when chatting about a given video, which is organized as a track of the 8th Dialog System Technology Challenge (DSTC8). To solve the task, we propose a universal multimodal transformer and introduce the multi-task learning method to learn joint representations among different modalities as well as generate informative and fluent responses. Our method extends the natural language generation pre-trained model to multimodal dialogue generation task. Our system achieves the best performance in both objective and subjective evaluations in the challenge.
研究动机与目标
- 为解决在视频-音频对话中生成流畅且上下文相关的回复的挑战,通过有效整合多种模态。
- 通过改善文本、视频和音频之间的联合表征学习,以提升对话生成质量。
- 将预训练语言模型(如 GPT-2)扩展至多模态对话生成任务,采用自监督多任务学习方法。
- 在 AVSD 任务中实现自动评估与人工评估的最先进结果。
提出的方法
- 该模型采用统一序列输入,整合视频、音频、字幕和对话历史的特征,每类特征前均添加唯一片段标记(如 [video]、[caption]、[user1])。
- 以预训练的 GPT-2 模型作为初始化,以利用其强大的语言生成能力。
- 采用多任务学习,包含三个目标:响应语言建模(RLM)、视频-音频序列建模(VASM)和字幕语言建模(CLM)。
- 通过在所有模态上进行掩码语言建模,端到端微调模型,以学习联合表征。
- 视频和音频特征通过 3D 卷积神经网络处理,音频嵌入与视觉特征融合后输入变换器。
- 解码采用束搜索(beam search),其在 AVSD 任务中展现出最佳自动评估指标。
实验结果
研究问题
- RQ1预训练语言模型(如 GPT-2)能否通过视频和音频输入有效适应多模态对话生成?
- RQ2在响应生成、视频-音频序列建模和字幕重建之间进行多任务学习,如何提升联合表征学习?
- RQ3联合编码文本、视频和音频是否优于使用注意力融合的独立模态编码器?
- RQ4当仅提供对话历史和视频-音频,而无字幕或摘要时,模型表现如何?
- RQ5在基于场景的对话设置中,哪种解码策略能取得最佳性能?
主要发现
- 在所有 DSTC8-AVSD 提交结果中,该模型在人工评估中得分最高(3.934),非常接近人类参考得分 4.000。
- 在文本 + 视频设置下,相比先前最先进模型(MTN),BLEU-4 提升 0.056,CIDEr 提升 0.216。
- 在仅文本设置下,该模型优于 DSTC7-AVSD 冠军系统,BLEU-4 提升 0.069,CIDEar 提升 0.185。
- 在完整输入设置下,使用视频-音频序列建模(VASM)使 BLEU-4 提升 0.011,CIDEr 提升 0.026。
- 束搜索解码在自动评估指标上表现最佳,优于贪婪搜索和核采样。
- 当使用多任务学习时,若缺少字幕或摘要作为辅助监督,模型在仅文本 + 视频设置下的表现较差,表明在缺乏辅助监督时,视频表征学习存在局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。