[论文解读] Unsupervised Visual-Linguistic Reference Resolution in Instructional Videos
本文提出了一种无监督图优化框架,联合建模视觉与语言线索,以解决教学视频中动作与实体之间的模糊指代问题——例如将‘dressing’与‘mix yogurt’关联起来——在最先进仅基于语言的模型基础上,精确率与召回率均提升了9%,表明多模态对齐可同时提升指代消解与视频转录对齐的效果。
We propose an unsupervised method for reference resolution in instructional videos, where the goal is to temporally link an entity (e.g., "dressing") to the action (e.g., "mix yogurt") that produced it. The key challenge is the inevitable visual-linguistic ambiguities arising from the changes in both visual appearance and referring expression of an entity in the video. This challenge is amplified by the fact that we aim to resolve references with no supervision. We address these challenges by learning a joint visual-linguistic model, where linguistic cues can help resolve visual ambiguities and vice versa. We verify our approach by learning our model unsupervisedly using more than two thousand unstructured cooking videos from YouTube, and show that our visual-linguistic model can substantially improve upon state-of-the-art linguistic only model on reference resolution in instructional videos.
研究动机与目标
- 解决教学视频中动作与实体之间模糊指代的挑战,其中视觉外观与语言表达随时间变化。
- 通过开发一种无监督方法,利用无标注的YouTube烹饪视频(无参考级别监督)来克服标注数据不足的问题。
- 通过联合建模视觉与语言信号,提升指代消解的鲁棒性,以解决因状态变化和指代表达转移带来的模糊性。
- 证明指代消解可增强视频-语音对齐效果,尤其对代词和模糊术语(如‘it’或‘mixture’)具有显著提升。
提出的方法
- 将指代消解建模为图优化问题,其中节点代表动作与实体,边代表时间上的指代关系。
- 引入一种动作图嵌入(action graph embedding),以捕捉帧间细粒度的视觉与语言关系,实现在外观与表达变化下的跨模态对齐。
- 使用一种联合视觉-语言模型,通过共享图结构交替优化视觉特征与语言表示。
- 应用基于帧的相似性函数(如FES),并结合动作图嵌入以提升指代消解效果,超越整体帧相似性方法。
- 利用视频与转录文本之间的时序对齐(Z)作为弱监督信号,以减少噪声并提升模型泛化能力。
- 在超过2,000段来自YouTube的非结构化烹饪视频上端到端无监督训练模型,无需任何真实参考标注。
实验结果
研究问题
- RQ1无监督视觉-语言模型是否能在存在视觉与语言模糊性的情况下,有效解决教学视频中动作与实体之间的指代问题?
- RQ2与单模态方法相比,联合建模视觉与语言信号在指代消解性能上提升程度如何?
- RQ3解决指代问题在多大程度上提升了非结构化视频转录与对应视频片段之间的对齐效果?
- RQ4所提出的基于图的优化框架是否能有效处理现实教学视频中的状态变化与指代表达转移?
主要发现
- 所提出的无监督联合视觉-语言模型在教学视频指代消解任务上,相比最先进仅基于语言的模型,精确率与召回率均提升9%。
- 该模型显著优于单模态基线:仅视觉模型因缺乏语言正则化而表现不佳,而仅语言模型则在视觉模糊性面前表现困难。
- 与基于帧相似度的方法(FES)相比,动作图嵌入使指代消解性能提升10%,从而更好地处理状态变化下的细粒度实体追踪。
- 通过时序对齐(Z)进行联合优化,可减少视觉监督中的噪声,并在指代消解与视频-转录对齐任务上均取得性能提升。
- 解决指代问题可增强视频-语音对齐:该模型在F1与IOU指标上优于标准句子嵌入方法,尤其在处理模糊代词(如‘it’)时表现更优。
- 定性结果表明,该模型能成功消解如‘mixture’指代多种食材组合、‘dressing’指代经处理后的实体等复杂指代,即使在视觉与语言表达发生剧烈变化时亦能保持鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。