[论文解读] Searching for Ambiguous Objects in Videos using Relational Referring Expressions
本文提出了 VIREF,一个用于在高度模糊场景中使用关系性指代表达进行视频目标检索的新数据集和深度学习框架。该方法提出了一种基于注意力机制的编码器-解码器 LSTM 模型,能够联合生成和理解关系性描述,在生成任务(BLEU-4: 0.2365,METEOR: 0.5492)和理解任务(mAP: 0.65,rank-1 准确率: 0.47)上均优于基线模型。
Humans frequently use referring (identifying) expressions to refer to objects. Especially in ambiguous settings, humans prefer expressions (called relational referring expressions) that describe an object with respect to a distinguishing, unique object. Unlike studies on video object search using referring expressions, in this paper, our focus is on (i) relational referring expressions in highly ambiguous settings, and (ii) methods that can both generate and comprehend a referring expression. For this goal, we first introduce a new dataset for video object search with referring expressions that includes numerous copies of the objects, making it difficult to use non-relational expressions. Moreover, we train two baseline deep networks on this dataset, which show promising results. Finally, we propose a deep attention network that significantly outperforms the baselines on our dataset. The dataset and the codes are available at https://github.com/hazananayurt/viref.
研究动机与目标
- 解决在存在多个相同类别目标实例的高模糊性场景中进行视频目标检索的挑战。
- 开发一个统一的深度学习框架,能够同时生成和理解视频中的关系性指代表达。
- 构建一个包含关系性指代表达的新数据集,明确描述目标对象相对于上下文对象的关系,以增强真实感和复杂性。
- 通过引入注意力机制建模对象之间的关系,提升基于视频的指代表达任务性能。
- 使模型能够生成和理解依赖于视频序列中对象之间空间、语义和动态关系的表达。
提出的方法
- 通过从 VIRAT 和 ILSVRC2015 视频数据集中收集关系性指代表达,构建新数据集 VIREF,重点关注高目标模糊性的场景。
- 设计一种基于编码器-解码器 LSTM 架构的双任务模型,生成与理解任务共享参数。
- 实现一种注意力机制,在解码过程中动态关注主要对象和上下文对象的相关特征,提升上下文理解能力。
- 使用从视频帧中提取的 VGG-16 特征作为视觉表示的输入嵌入,结合对象级特征和动作嵌入。
- 采用交叉熵损失进行生成任务训练,使用对比排序损失进行理解任务训练,实现两个任务的端到端联合优化。
- 提出三种变体:VIREF-e(全连接编码器)、VIREF-a(基于注意力的编码器)和 VIREF(带注意力的完整模型),支持消融实验与对比分析。
实验结果
研究问题
- RQ1统一的深度学习模型能否在高模糊性视频场景中有效生成和理解关系性指代表达?
- RQ2与基线模型相比,在视频指代表达任务中引入对对象对的注意力机制在多大程度上提升了性能?
- RQ3在高模糊性条件下,使用关系性表达(即相对于上下文对象描述目标对象)在多大程度上提升了视频目标检索的准确性?
- RQ4不同编码器架构(如全连接与基于注意力的)对生成和理解性能有何影响?
- RQ5训练数据的多样性与语言变异性在多大程度上影响了视频指代表达模型的泛化能力?
主要发现
- 所提出的 VIREF 模型在指代表达生成与理解任务中均达到最高性能,优于两种基线模型的所有指标。
- 在测试集上,VIREF 的 BLEU-4 得分为 0.2365,METEOR 得分为 0.5492,显著优于 VIREF-e(BLEU-4: 0.1197)和 VIREF-a(BLEU-4: 0.1498)。
- 在理解任务中,VIREF 的 mAP 为 0.65,rank-1 准确率为 0.47,优于 VIREF-e(mAP: 0.55,rank-1: 0.35)和 VIREF-a(mAP: 0.46,rank-1: 0.26)。
- 模型的注意力机制通过在解码过程中动态聚焦于相关视觉与语言特征,显著提升了性能。
- 尽管词汇多样性更高,VIREF-e 生成的表达语义意义较弱,这对其 BLEU 和 METEOR 得分产生了负面影响,表明词汇丰富性与语义正确性之间存在权衡。
- 模型展现出强大的泛化能力,完整版 VIREF 架构在性能、参数效率和推理速度之间实现了最佳平衡(平均生成耗时 1.403 秒,理解耗时 0.252 秒)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。