[论文解读] End-to-End Audio Visual Scene-Aware Dialog using Multimodal Attention-Based Video Features
本文提出了一种端到端的视听场景感知对话系统,通过视频、音频和对话历史的多模态注意力特征,生成关于动态视频场景的自然语言响应。通过将I3D视频特征与VGGish音频嵌入结合,并引入多模态注意力机制,该模型在新构建的9,000段视频对话数据集上显著提升了响应质量,达到当前最优性能。
Dialog systems need to understand dynamic visual scenes in order to have conversations with users about the objects and events around them. Scene-aware dialog systems for real-world applications could be developed by integrating state-of-the-art technologies from multiple research areas, including: end-to-end dialog technologies, which generate system responses using models trained from dialog data; visual question answering (VQA) technologies, which answer questions about images using learned image features; and video description technologies, in which descriptions/captions are generated from videos using multimodal information. We introduce a new dataset of dialogs about videos of human behaviors. Each dialog is a typed conversation that consists of a sequence of 10 question-and-answer(QA) pairs between two Amazon Mechanical Turk (AMT) workers. In total, we collected dialogs on roughly 9,000 videos. Using this new dataset for Audio Visual Scene-aware dialog (AVSD), we trained an end-to-end conversation model that generates responses in a dialog about a video. Our experiments demonstrate that using multimodal features that were developed for multimodal attention-based video description enhances the quality of generated dialog about dynamic scenes (videos). Our dataset, model code and pretrained models will be publicly available for a new Video Scene-Aware Dialog challenge.
研究动机与目标
- 开发一种能够实时对话动态视觉与听觉场景的端到端对话系统。
- 弥合静态图像视觉对话与动态视频理解在人机交互中的差距。
- 构建一个由人工标注的视频对话新基准数据集,用于训练与评估场景感知对话系统。
- 评估多模态特征(视频:I3D,音频:VGGish,对话历史:QA)在提升响应生成质量方面的有效性。
- 实现端到端学习,联合优化视觉、听觉与语言表征,以生成更自然且上下文准确的对话响应。
提出的方法
- 该模型采用编码器-解码器架构,并引入多模态注意力机制,融合来自视频(I3D RGB与光流)、音频(VGGish)和对话历史(问题-答案对)的特征。
- 视频特征通过在Kinetics数据集上预训练的I3D网络提取,音频特征通过VGGish提取,两者均投影至256维空间后进行融合。
- 多模态注意力机制在解码过程中动态关注相关的视觉、音频与语言特征,实现上下文感知的响应生成。
- 系统使用ADAM优化器与交叉熵损失进行端到端训练,经过20个周期,在开发集上最小化困惑度。
- 解码器采用两层LSTM,每层128个单元,响应生成通过束搜索(beam search)与n-best假设选择实现。
- 使用人工标注字幕的特征作为强基线,以评估自动视觉与音频特征提取的必要性。
实验结果
研究问题
- RQ1端到端对话系统能否有效利用多模态输入,生成关于动态视频场景的响应?
- RQ2视觉、音频与对话历史特征的不同组合如何影响场景感知对话中的响应质量?
- RQ3多模态注意力机制的引入是否优于模态的早期或晚期融合?
- RQ4在零样本或低资源设置下,自动提取的视频与音频特征在多大程度上优于人工标注字幕?
- RQ5所提出的模型能否在缺乏人工标注字幕的真实世界应用中实现泛化?
主要发现
- 采用QA + I3D + VGGish并结合多模态注意力机制的模型,CIDEr得分达到最高值0.727,显著优于仅使用QA的基线模型(CIDEr = 0.618)。
- 在I3D基础上添加VGGish音频特征,CIDEr得分从0.701提升至0.727,表明音频模态对性能有显著贡献。
- 仅添加I3D特征(QA + I3D)即可使CIDEr从0.618提升至0.680,表明视频运动特征能有效提升响应质量。
- 与非注意力融合方法相比,多模态注意力机制使CIDEr相对提升4.4%(0.701 vs. 0.727),证实其在特征融合中的有效性。
- 使用QA + 人工标注字幕的模型CIDEr得分为0.618,但被基于自动特征的模型超越,表明学习到的特征在对话生成中可匹配甚至超越人工字幕。
- 当引入VGGish时,系统生成的与音频相关响应更准确——例如正确识别出音乐与背景噪音,证明了音频模态对感知准确性的显著影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。