[论文解读] Learning to Track Any Object
该论文提出了一种统一框架,通过可学习的对象存在先验,将类别特定的目标检测器重新用于类别无关、对象特定的跟踪。通过在图像和视频数据上联合训练,并应用可微分的、实时的线性模板自适应方法,该方法在仅使用第一帧的框级监督的情况下,实现了最先进的跟踪和视频实例分割性能,生成高质量的实例掩码。
Object tracking can be formulated as "finding the right object in a video". We observe that recent approaches for class-agnostic tracking tend to focus on the "finding" part, but largely overlook the "object" part of the task, essentially doing a template matching over a frame in a sliding-window. In contrast, class-specific trackers heavily rely on object priors in the form of category-specific object detectors. In this work, we re-purpose category-specific appearance models into a generic objectness prior. Our approach converts a category-specific object detector into a category-agnostic, object-specific detector (i.e. a tracker) efficiently, on the fly. Moreover, at test time the same network can be applied to detection and tracking, resulting in a unified approach for the two tasks. We achieve state-of-the-art results on two recent large-scale tracking benchmarks (OxUvA and GOT, using external data). By simply adding a mask prediction branch, our approach is able to produce instance segmentation masks for the tracked object. Despite only using box-level information on the first frame, our method outputs high-quality masks, as evaluated on the DAVIS '17 video object segmentation benchmark.
研究动机与目标
- 为解决通用、用户初始化的目标跟踪挑战,通过从类别特定检测器中提取的通用对象存在先验来实现。
- 通过以可微分、端到端的方式学习判别性对象模板,提升对干扰物和外观变化的鲁棒性。
- 在单一架构下统一目标检测、单对象跟踪和视频对象分割,仅需极少的监督信号。
- 在大规模跟踪和视频分割基准上实现最先进性能,且无需在测试序列上进行微调。
提出的方法
- 通过在图像(COCO)和视频(OxUvA, GOT10k)数据集上联合训练,将类别特定的Mask R-CNN检测器重新用于类别无关的跟踪器。
- 引入一种可微分的、闭式解的线性判别器(T_d),利用第一帧的特征将目标与背景和干扰物分离。
- 使用模板嵌入计算相似性图,以重新加权后续帧的特征,实现对跟踪目标的精确定位。
- 通过增加掩码预测头,实现在仅第一帧具有框级监督条件下的实例分割和视频对象分割。
- 在推理阶段应用简单的时序启发式方法,以在长序列中保持跟踪的一致性。
- 使用同一套网络进行检测、跟踪和分割,实现统一的端到端流水线。
实验结果
研究问题
- RQ1是否可以有效将类别特定检测器重新用于通用、对象特定的跟踪器,而无需类别特定的先验?
- RQ2可微分的、实时的模板自适应策略在多大程度上能提升对干扰物和外观变化的鲁棒性?
- RQ3在检测任务上进行训练的统一模型,在多大程度上也能在跟踪和视频对象分割任务上实现最先进性能?
- RQ4是否可以仅通过第一帧的框级监督,在统一架构下生成高质量的实例分割掩码?
主要发现
- 在OxUvA长时序跟踪基准上,该方法实现了最先进性能,优于先前方法且无需外部数据。
- 在GOT10k基准上,该方法优于使用外部数据的最先进方法,在跟踪精度上具有显著优势。
- 在LTB35数据集(VOT 2018长时序挑战)上,该方法使用单一模型和超参数配置,在所有实验中均取得61.2的F-measure,优于需要数据集特定调优的先前方法。
- 在DAVIS’17视频分割基准上,该方法实现了67.8的平均F-measure和59.2的平均交并比,性能与需要像素级掩码监督或端到端微调的专用方法相当。
- 尽管仅使用第一帧的框级标注,该方法仍能生成高质量的分割掩码,F-measure衰减仅为12.0,表明对外观变化具有强鲁棒性。
- 当用作检测器时,该模型在COCO实例分割上达到30.5的mAP,表明其在仅优化跟踪任务的情况下仍具备强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。