[论文解读] On Duality Of Multiple Target Tracking and Segmentation
该论文提出了一种双重优化框架,通过拉格朗日对偶分解联合求解在线多目标跟踪与视频实例分割,实现相互提升:分割提供精确的前景掩码以减少跟踪漂移和ID切换,而跟踪则通过时序一致性指导分割。该方法在多个基准测试上均实现了最先进性能。
Traditionally, object tracking and segmentation are treated as two separate problems and solved independently. However, in this paper, we argue that tracking and segmentation are actually closely related and solving one should help the other. On one hand, the object track, which is a set of bounding boxes with one bounding box in every frame, would provide strong high-level guidance for the target/background segmentation task. On the other hand, the object segmentation would separate object from other objects and background, which will be useful for determining track locations in every frame. We propose a novel framework which combines online multiple target tracking and segmentation in a video. In our approach, the tracking and segmentation problems are coupled by Lagrange dual decomposition, which leads to more accurate segmentation results and also \emph{helps resolve typical difficulties in multiple target tracking, such as occlusion handling, ID-switch and track drifting}. To track targets, an individual appearance model is learned for each target via structured learning and network flow is employed to generate tracks from densely sampled candidates. For segmentation, multi-label Conditional Random Field (CRF) is applied to a superpixel based spatio-temporal graph in a segment of video to assign background or target labels to every superpixel. The experiments on diverse sequences show that our method outperforms state-of-the-art approaches for multiple target tracking as well as segmentation.
研究动机与目标
- 解决将跟踪与分割视为独立问题的局限性,其中跟踪中的粗略边界框会导致特征污染与漂移。
- 利用目标轨迹(边界框)与像素级分割之间的强相关性,同时提升两个任务的性能。
- 通过引入像素级分割作为监督信号,解决遮挡、ID切换和轨迹漂移等常见跟踪挑战。
- 构建一个统一的优化框架,通过对偶分解耦合跟踪与分割,实现迭代优化。
- 在无需预训练检测器的前提下,实现端到端在线性能,利用结构化学习构建自适应外观模型。
提出的方法
- 使用拉格朗日对偶分解将跟踪与分割子问题耦合,对偶变量用于强制边界框与像素标签之间的一致性。
- 在跟踪方面,通过结构化学习为每个目标学习独立的判别性外观模型,并在密集采样的候选框上使用网络流生成轨迹。
- 在分割方面,为每个目标构建前景高斯混合模型(GMM),并构建一个通用背景GMM以生成置信度图,随后在基于超像素的时空图上应用多标签条件随机场(CRF)。
- 迭代优化两个子问题:分割通过像素级标签优化轨迹建议,而跟踪通过一致的边界框约束改进分割。
- 采用在线学习在推理过程中自适应更新外观模型,提升对外观变化与遮挡的鲁棒性。
- 在某些情况下使用人工提供的检测结果进行初始化,但允许通过联合优化自动发现目标。
实验结果
研究问题
- RQ1与独立求解相比,联合优化跟踪与分割是否能提升两个任务的性能?
- RQ2像素级分割结果在多大程度上可减少遮挡期间的ID切换与漂移等跟踪误差?
- RQ3跟踪约束在多大程度上可提升视频分割的准确率与时序一致性?
- RQ4对偶分解是否能有效耦合跟踪与分割,而无需依赖预训练检测器?
- RQ5粗粒度边界框跟踪与细粒度分割之间的相互优化,是否能在具有挑战性的序列上带来更好的泛化能力?
主要发现
- 所提方法在多目标跟踪与视频实例分割两个任务上均达到最先进性能,在PETS-S2L1、TUD-Crossing与TUD-Stadtmitte数据集上优于先前方法。
- 在PETS-S2L1数据集上,该方法达到MOTA为92.5、IDS为0,显著优于先前跟踪器,且大幅减少了ID切换。
- 在TUD-Crossing数据集上,该方法达到MOTA为91.7、IDS为0,展现出对遮挡与复杂场景的强鲁棒性。
- 在TUD-Stadtmitte数据集上,该方法达到MOTA为83.8、IDS为0,表明在人群密集环境中仍具有优异表现。
- 联合优化通过利用分割结果在遮挡期间维持身份一致性,显著减少了轨迹漂移与ID切换。
- 消融实验表明,引入分割可显著提升仅跟踪基线模型(Ours-Track)的性能,证实了两项任务之间的相互增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。