[论文解读] Tracking Instances as Queries
该论文提出 QueryTrack,一种统一的、端到端的基于查询的视频实例分割框架,将跟踪实例视为可学习查询,利用查询与实例之间的一一对应关系实现鲁棒的时序关联。该方法在 YouTube-VIS-2021 上达到 52.7% AP,在 CVPR 2021 比赛中以单一在线模型、单尺度推理和适度的训练数据获得第二名。
Recently, query based deep networks catch lots of attention owing to their end-to-end pipeline and competitive results on several fundamental computer vision tasks, such as object detection, semantic segmentation, and instance segmentation. However, how to establish a query based video instance segmentation (VIS) framework with elegant architecture and strong performance remains to be settled. In this paper, we present extbf{QueryTrack} (i.e., tracking instances as queries), a unified query based VIS framework fully leveraging the intrinsic one-to-one correspondence between instances and queries in QueryInst. The proposed method obtains 52.7 / 52.3 AP on YouTube-VIS-2019 / 2021 datasets, which wins the 2-nd place in the YouTube-VIS Challenge at CVPR 2021 extbf{with a single online end-to-end model, single scale testing \& modest amount of training data}. We also provide QueryTrack-ResNet-50 baseline results on YouTube-VIS-2021 val set as references for the VIS community.
研究动机与目标
- 解决现有视频实例分割(VIS)方法依赖启发式、不可微分后处理进行帧间实例关联的局限性。
- 建立一种统一的、端到端的基于查询的 VIS 框架,借鉴 QueryInst 中实例与查询之间固有的 1:1 对应关系。
- 通过引入专用的跟踪头,减少在时序实例匹配中对超参数和人工设计算子的依赖。
- 利用更可靠的 YouTube-VIS-2021 基准,为未来 VIS 研究提供一个强大且可复现的基线。
- 在受限的训练数据和单尺度推理条件下,通过简洁优雅的架构实现最先进性能。
提出的方法
- QueryTrack 基于 QueryInst,采用基于查询的实例分割主干网络,在网络各阶段保持对象查询与检测实例之间的一一映射关系。
- 提出一种新颖的跟踪头,利用查询表征实现时序实例关联,将启发式匹配替换为可微分的、基于查询的跟踪机制。
- 该跟踪头利用前一帧的查询特征,预测当前帧中每个实例的位置和掩码,从而实现端到端优化。
- 框架使用特征金字塔(FPN)和动态卷积模块,对查询特征进行精细化处理,提升检测与分割精度。
- 推理阶段仅保留每帧中得分最高的前 10 个查询,确保效率并可扩展至实例数量有限的真实视频。
- 训练采用标准数据增强(随机翻转、多尺度输入、随机裁剪),学习率采用余弦衰减调度,推理时固定使用 100 个查询。
实验结果
研究问题
- RQ1基于查询的框架能否通过可学习查询直接建模实例跟踪,实现端到端的视频实例分割?
- RQ2利用查询与实例之间的一一对应关系,如何提升时序关联的鲁棒性并降低对超参数的敏感性?
- RQ3在最小化训练数据设置和单尺度推理下,基于查询的跟踪机制能带来多大的性能提升?
- RQ4在更可靠的 YouTube-VIS-2021 基准上,该方法与最先进 VIS 模型相比表现如何?
- RQ5QueryTrack 能否作为未来视频实例分割研究的强可复现基线?
主要发现
- QueryTrack 在 YouTube-VIS-2021 测试集上达到 52.7% AP,以单一在线端到端模型在 CVPR 2021 比赛中获得第二名。
- 在 YouTube-VIS-2021 验证集上,使用 ResNet-50 主干网络的 QueryTrack 达到 38.8% AP、62.0% AP50 和 42.3% AP75,确立了强有力的基线表现。
- 该方法在 YouTube-VIS-2019 数据集上优于最先进模型如 MaskTrack R-CNN、SipMask-VIS、CrossVIS 和 IFC,使用 Swin-L 主干网络时达到 48.8% AP,使用 ResNeXt-101-DCN 主干网络时达到 52.7% AP。
- 所提出的跟踪头显著减少了与传统启发式关联方法相比的超参数数量,提升了训练稳定性和泛化能力。
- 结果表明,即使在训练数据有限和单尺度推理条件下,基于查询的跟踪机制也极为有效,优于依赖大规模数据(如 Open Images)的方法。
- 作者主张使用 YouTube-VIS-2021 基准,因其相比 2019 版本具有更低的方差和更高的可复现性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。