Skip to main content
QUICK REVIEW

[论文解读] Dynamic Graph Representation Learning for Video Dialog via Multi-Modal Shuffled Transformers

Shijie Geng, Peng Gao|arXiv (Cornell University)|Jul 8, 2020
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出了一种用于视频对话的动态图表示学习框架,采用新颖的时空场景图(STSGR)与打乱的Transformer架构。通过图注意力机制和边卷积捕捉帧内视觉语义,并聚合跨帧的时间线索,该方法在AVSD基准测试中生成答案与选择答案两项任务上均达到最先进性能,所有指标均优于先前方法,包括CIDEr得分1.272(DSTC8)。

ABSTRACT

Given an input video, its associated audio, and a brief caption, the audio-visual scene aware dialog (AVSD) task requires an agent to indulge in a question-answer dialog with a human about the audio-visual content. This task thus poses a challenging multi-modal representation learning and reasoning scenario, advancements into which could influence several human-machine interaction applications. To solve this task, we introduce a semantics-controlled multi-modal shuffled Transformer reasoning framework, consisting of a sequence of Transformer modules, each taking a modality as input and producing representations conditioned on the input question. Our proposed Transformer variant uses a shuffling scheme on their multi-head outputs, demonstrating better regularization. To encode fine-grained visual information, we present a novel dynamic scene graph representation learning pipeline that consists of an intra-frame reasoning layer producing spatio-semantic graph representations for every frame, and an inter-frame aggregation module capturing temporal cues. Our entire pipeline is trained end-to-end. We present experiments on the benchmark AVSD dataset, both on answer generation and selection tasks. Our results demonstrate state-of-the-art performances on all evaluation metrics.

研究动机与目标

  • 为解决音频-视觉场景感知对话(AVSD)中的多模态表征学习与推理挑战,其中输入包含视频、音频、字幕和对话历史。
  • 通过捕捉视频中细粒度的视觉语义与时间依赖性,提升对复杂多模态输入的推理能力。
  • 通过在多头注意力输出上引入新颖的打乱机制,提升多模态Transformer的泛化能力并减少过拟合。
  • 构建一种分层表征学习流程,端到端融合视觉、音频与语言模态,以实现有效的对话生成与选择。

提出的方法

  • 提出一种时空场景图表征(STSGR),利用图注意力与边卷积在帧级别构建视觉图,以编码对象关系与空间上下文。
  • 引入帧间聚合模块,通过时间邻近帧传播与更新视觉表征,构建紧凑且动态的视觉记忆。
  • 采用多模态打乱Transformer,其中多头注意力头的输出在融合前被随机打乱,以提升正则化与泛化能力。
  • 通过顺序的Transformer解码器,将音频-视觉记忆与对话历史、字幕及问题嵌入进行融合,条件基于输入问题。
  • 采用端到端训练,联合优化视觉图学习、模态融合与答案生成或选择。
  • 利用音频特征与视频帧之间的时间对齐,确保多模态表征学习的一致性。

实验结果

研究问题

  • RQ1与整体视频特征相比,基于动态图的视觉表征是否能提升视频对话系统中的推理能力?
  • RQ2所提出的打乱Transformer架构在多模态序列建模中如何提升泛化能力并减少过拟合?
  • RQ3融合帧内与帧间推理在复杂AVSD任务上的性能提升程度如何?
  • RQ4将场景图与音频-视觉及语言模态结合,是否能实现优于先前方法的答案生成与选择?
  • RQ5当关键模态(如字幕或对话历史)被移除时,模型的性能与鲁棒性如何变化?

主要发现

  • 所提出的STSGR模型在AVSD基准上达到最先进性能,DSTC8上CIDEr得分为1.272,DSTC7上为1.249,优于先前所有方法,包括MTN与多模态注意力模型。
  • 在答案选择任务中,完整模型的平均检索排名为4.08,无字幕设置下为5.91,显著优于基线的7.41与6.54。
  • 消融实验表明,将音频引入STSGR表征可提升性能,完整模态下平均检索排名从4.67降至4.08。
  • 仅使用STSGR表征即可在生成任务上超越I3D与VGG特征,使用场景图的CIDEr得分为1.265,而MTN使用I3D的得分为1.249。
  • 定性结果表明,模型能有效追踪帧间对象,并在复杂场景中以高置信度回答时空问题。
  • 打乱Transformer变体通过在所有评估指标与消融设置中保持一致的性能提升,有效减少过拟合并提升泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。