Skip to main content
QUICK REVIEW

[论文解读] Tracking Anything in High Quality

Jiawen Zhu, Zhenyu Chen|arXiv (Cornell University)|Jul 26, 2023
Visual Attention and Saliency Detection被引用 5
一句话总结

该论文提出 HQTrack,一种用于高质量视频目标跟踪与分割的两阶段框架,通过使用预训练的 HQ-SAM 模型将视频多目标分割器(VMOS)与掩码优化器(MR)相结合。通过基于 IoU 阈值筛选性地优化低 IoU 掩码,HQTrack 在无需推理时数据增强或模型集成的情况下,实现了 SOTA 性能,在 VOTS2023 挑战赛中排名第二。

ABSTRACT

Visual object tracking is a fundamental video task in computer vision. Recently, the notably increasing power of perception algorithms allows the unification of single/multiobject and box/mask-based tracking. Among them, the Segment Anything Model (SAM) attracts much attention. In this report, we propose HQTrack, a framework for High Quality Tracking anything in videos. HQTrack mainly consists of a video multi-object segmenter (VMOS) and a mask refiner (MR). Given the object to be tracked in the initial frame of a video, VMOS propagates the object masks to the current frame. The mask results at this stage are not accurate enough since VMOS is trained on several closeset video object segmentation (VOS) datasets, which has limited ability to generalize to complex and corner scenes. To further improve the quality of tracking masks, a pretrained MR model is employed to refine the tracking results. As a compelling testament to the effectiveness of our paradigm, without employing any tricks such as test-time data augmentations and model ensemble, HQTrack ranks the 2nd place in the Visual Object Tracking and Segmentation (VOTS2023) challenge. Code and models are available at https://github.com/jiawen-zhu/HQTrack.

研究动机与目标

  • 解决复杂视频序列中长期跟踪、遮挡、干扰物以及外观变化带来的挑战。
  • 在标准视频目标分割模型的基础上进一步提升掩码质量,尤其针对小尺寸、高速运动或严重遮挡的目标。
  • 开发一种鲁棒且可泛化的跟踪系统,能够同时处理单目标与多目标跟踪,并输出密集掩码。
  • 通过引入基于 IoU 阈值的筛选性优化策略,最小化因优化低质量掩码而导致的性能下降。

提出的方法

  • VMOS 是一种基于 DeAOT 的增强型视频多目标分割器,采用 InternImage-T 作为主干网络以提升特征表示能力,并引入 1/8 分辨率的门控传播模块以增强对小目标的感知能力。
  • 采用固定长度的长期记忆机制,以管理长视频序列中的内存使用,在超过阈值后丢弃早期帧的记忆。
  • 掩码优化器(MR)使用预训练的 HQ-SAM_H 模型,对 VMOS 输出的分割掩码进行优化,提升复杂结构的准确性。
  • 应用筛选性优化策略:仅当 VMOS 与 SAM 输出之间的 IoU > τ 时,才替换掩码,从而避免在低质量预测上造成性能下降。
  • IoU 阈值 τ 在验证集上进行优化,τ = 0.1 时取得最佳性能。
  • 该框架在 VOS 数据集上端到端训练,并在 VOTS2023 上进行微调,推理过程不使用测试时数据增强或集成方法。

实验结果

研究问题

  • RQ1结合视频多目标分割器与大规模掩码优化器的两阶段跟踪框架,是否能在输出密集掩码的长期、多目标视频跟踪任务中实现 SOTA 性能?
  • RQ2使用类似 HQ-SAM_H 的预训练大模型进行筛选性掩码优化,在避免低质量预测性能下降方面有多高效?
  • RQ3在超过 10,000 帧的长视频序列中,如何实现内存效率与长期跟踪鲁棒性之间的最佳平衡?
  • RQ4使用更强的主干网络(如 InternImage-T)和门控传播机制,如何提升复杂场景中小目标的跟踪性能?

主要发现

  • HQTrack 在 VOTS2023 测试集上取得了 0.615 的 AUC 得分,在未使用测试时数据增强或模型集成的情况下排名第二。
  • 将 VMOS 中的 ResNet50 主干网络替换为 InternImage-T 后,AUC 提升了 3.2%,证明了更强特征提取能力的优势。
  • 引入 SAM_H 进行掩码优化后,AUC 相较于仅使用 VMOS 提升了 1.4%,凸显了大规模预训练模型的价值。
  • 采用 τ = 0.1 的筛选性优化策略取得了最佳性能,有效减少了低 IoU 掩码的性能下降,同时在各类挑战下保持了高精度。
  • 该框架成功处理了长序列(>10,000 帧)、快速运动、遮挡和干扰物,展现出在真实场景中的强大鲁棒性。
  • 定性结果表明,HQTrack 即使在严重外观变化和尺度变化下,也能生成高度准确且稳定的掩码。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。