Skip to main content
QUICK REVIEW

[论文解读] Learning Reasoning Paths over Semantic Graphs for Video-grounded Dialogues

Hung Lê, Nancy F. Chen|arXiv (Cornell University)|Mar 1, 2021
Multimodal Machine Learning Applications参考文献 62被引用 6
一句话总结

该论文提出了一种新颖的框架——对话上下文中的推理路径(PDC),用于视频对齐对话,通过利用问题和回答的词汇与句法成分构建的语义图,建模对话回合之间的长距离依赖关系。通过在图上学习动态推理路径进行基于特征的传播,PDC 能够从历史对话回合中检索相关的视觉线索,从而提升答案生成性能,其表现与最优路径(oracle paths)相当,并在 AVSD@DSTC7 上优于固定路径基线模型。

ABSTRACT

Compared to traditional visual question answering, video-grounded dialogues require additional reasoning over dialogue context to answer questions in a multi-turn setting. Previous approaches to video-grounded dialogues mostly use dialogue context as a simple text input without modelling the inherent information flows at the turn level. In this paper, we propose a novel framework of Reasoning Paths in Dialogue Context (PDC). PDC model discovers information flows among dialogue turns through a semantic graph constructed based on lexical components in each question and answer. PDC model then learns to predict reasoning paths over this semantic graph. Our path prediction model predicts a path from the current turn through past dialogue turns that contain additional visual cues to answer the current question. Our reasoning model sequentially processes both visual and textual information through this reasoning path and the propagated features are used to generate the answer. Our experimental results demonstrate the effectiveness of our method and provide additional insights on how models use semantic dependencies in a dialogue context to retrieve visual cues.

研究动机与目标

  • 为解决现有视频对齐对话模型在捕捉对话回合之间长距离依赖关系方面的局限性。
  • 利用词汇与句法成分作为桥梁实体,建模多轮对话中的语篇级语义结构。
  • 开发一种可学习的推理路径机制,引导从相关历史回合到当前回合的多模态特征传播。
  • 通过沿动态预测的推理路径整合视觉与文本特征,提升答案生成质量。
  • 证明所学习的推理路径可优于固定路径或随机路径传播策略在视频对话中的表现。

提出的方法

  • 使用从每轮对话的问题与回答中通过句法依存分析提取的子节点(实体、动作短语)构建回合级语义图。
  • 通过词汇重叠或语义相似度(利用预训练词嵌入与余弦相似度)连接不同回合的节点,形成图中的边。
  • 训练一个 Transformer 解码器,基于先前生成的索引回归下一个回合的索引,以预测从当前回合到历史回合的推理路径。
  • 使用图卷积网络(GCN)沿预测的推理路径传播视觉与文本特征,逐步整合多模态信息。
  • 将最终传播的特征与 Transformer 解码器结合,生成答案,实现路径预测与响应生成的端到端联合优化。
  • 采用束搜索或贪婪解码进行路径生成,消融实验对比所学习路径与固定路径(如最近 n 轮)及最优路径的表现。

实验结果

研究问题

  • RQ1所学习的推理路径机制是否能通过捕捉对话回合之间的长程依赖关系,提升视频对齐对话的性能?
  • RQ2利用词汇与句法成分构建的语义图在识别当前问答任务中相关历史对话回合方面有多有效?
  • RQ3动态路径学习是否优于仅使用最近 n 轮的固定传播策略?
  • RQ4模型预测的推理路径在多大程度上可达到已知最优相关回合序列的最优路径性能?
  • RQ5不同的路径生成策略(束搜索 vs. 贪婪解码)如何影响最终响应质量与计算成本?

主要发现

  • 采用所学习推理路径的 PDC 模型在 CIDEr 指标上达到 1.195,与最优路径性能相当,并显著优于随机路径或固定路径基线(如随机路径的 CIDEr 为 0.684)。
  • 采用束搜索或贪婪路径生成的模型性能几乎完全一致(CIDEr:1.194–1.195),表明由于路径长度较短,贪婪解码已足够满足路径生成需求。
  • 即使在 n 较大(如最近 10 轮)的情况下,该模型仍优于仅使用最近 n 轮的基线模型,表明所学习的路径比启发式时间序列更有效。
  • 定性分析表明,预测的推理路径能正确跳过无关回合(如示例 A 中的第 8 轮),仅连接语义相关的过去回合(如提及“the bag”或“the cushion”的回合)。
  • 采用非参数化图构建方式(余弦相似度)与预训练嵌入,可在无需额外训练图结构的情况下实现有效的语义连接。
  • 路径生成与答案生成的联合训练相比分离训练,能带来更优的特征传播效果与更高的答案质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。