[论文解读] RefVOS: A Closer Look at Referring Expressions for Video Object Segmentation
本文提出 RefVOS,一种端到端深度神经网络,利用基于 BERT 的语言编码,在语言引导的视频实例分割任务中实现最先进性能。研究揭示,现有基准测试主要受简单指代表达支配,且运动和静态动作是主要挑战,模型在非简单案例中的性能显著下降,尤其是在指代表达描述静态动作或运动时。
The task of video object segmentation with referring expressions (language-guided VOS) is to, given a linguistic phrase and a video, generate binary masks for the object to which the phrase refers. Our work argues that existing benchmarks used for this task are mainly composed of trivial cases, in which referents can be identified with simple phrases. Our analysis relies on a new categorization of the phrases in the DAVIS-2017 and Actor-Action datasets into trivial and non-trivial REs, with the non-trivial REs annotated with seven RE semantic categories. We leverage this data to analyze the results of RefVOS, a novel neural network that obtains competitive results for the task of language-guided image segmentation and state of the art results for language-guided VOS. Our study indicates that the major challenges for the task are related to understanding motion and static actions.
研究动机与目标
- 分析现有视频实例分割基准中指代表达(REs)的语言复杂性,揭示其以简单案例为主导。
- 提出一种新的指代表达语义分类体系,划分为七种类别,包括外观、位置、运动、静态动作等,以更好地理解语言层面的挑战。
- 开发 RefVOS,一种新型端到端模型,在 DAVIS-2017 和 Actor-Action(A2D)基准上实现语言引导视频实例分割的最先进性能。
- 在不同指代表达语义类别下评估模型性能,识别出最具挑战性的语言类型。
- 通过按语义类别标注的新非简单指代表达,扩展 A2D 数据集,以实现对视频中语言定位更严格的评估。
提出的方法
- RefVOS 使用 BERT 将指代表达编码为上下文嵌入,通过交叉注意力机制与视频特征融合,生成像素级分割掩码。
- 模型在带有真实掩码的视频帧上进行端到端训练,采用多尺度特征金字塔网络以捕捉空间上下文信息。
- 作者提出一种新的标注方案,将指代表达划分为七种类别:外观、位置、运动、静态、动作、关系和通用。
- 在 A2D 数据集中新增 140 个非简单指代表达,确保各类语义类别覆盖均衡,以实现公平比较。
- 采用 DAVIS-2017 和扩展后的 A2D 数据集上的平均交并比(mIoU)评估性能,并按简单与非简单指代表达及语义类别进行分析。
- 通过比较仅含主语、仅含动作或完整短语等不同语言输入下的模型性能,分离语言成分的贡献。
实验结果
研究问题
- RQ1当前语言引导视频实例分割基准在多大程度上由可仅通过简单线索解决的简单指代表达构成?
- RQ2在外观、位置、运动、静态动作等语义类别中,哪一类指代表达对最先进模型构成最大挑战?
- RQ3当指代表达仅包含主语、仅包含动作或两者兼具时,RefVOS 的性能如何变化,相较于完整语言短语?
- RQ4指代表达中包含运动或静态动作描述是否显著降低模型性能?如果是,原因是什么?
- RQ5对指代表达进行更细致的分类是否能提升未来视频实例分割模型的评估与开发?
主要发现
- 在 DAVIS-2017 上,非简单指代表达的平均 IoU 为 46.2,显著低于简单案例的 48.7,表明非简单 REs 更具挑战性。
- 在 A2D 数据集上,非简单 REs 的平均 IoU 为 33.2,而简单案例为 53.9,显示出复杂表达下性能的显著下降。
- 包含静态动作描述(如 'holding', 'sitting')时,模型性能最差,平均 IoU 从无该描述时的 36.21 降至 34.28,表明模型在处理静态动作时存在显著困难。
- 与运动相关的指代表达并未提升性能,模型在有无运动线索时表现相近(35.58 vs. 35.60 mIoU),表明其未能有效利用运动信息。
- 仅使用指代表达中的主语时,平均 IoU 为 51.3,显著高于仅使用动作描述时的 43.0,表明主语身份比动作描述更具信息量。
- 在 A2D 上,完整语言短语实现最高的平均 IoU(49.7),甚至优于同时包含主语和动作的配置,凸显完整语言上下文对非简单案例的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。