Skip to main content
QUICK REVIEW

[论文解读] PointTrack++ for Effective Online Multi-Object Tracking and Segmentation

Zhenbo Xu, Wei Zhang|arXiv (Cornell University)|Jul 3, 2020
Video Surveillance and Tracking Methods参考文献 10被引用 4
一句话总结

PointTrack++ 提出了一种改进的在线多目标跟踪与实例分割(MOTS)框架,通过语义分割头、复制粘贴数据增强和多阶段训练,提升了实例分割质量和嵌入可区分性。该方法在 KITTI MOTS 排行榜和第5届 BMTT MOTS 挑战赛中取得最先进性能,汽车的 sMOTSA 和 MOTSA 分别达到 86.81% 和 95.95%,行人则分别达到 65.51% 和 81.54%。

ABSTRACT

Multiple-object tracking and segmentation (MOTS) is a novel computer vision task that aims to jointly perform multiple object tracking (MOT) and instance segmentation. In this work, we present PointTrack++, an effective on-line framework for MOTS, which remarkably extends our recently proposed PointTrack framework. To begin with, PointTrack adopts an efficient one-stage framework for instance segmentation, and learns instance embeddings by converting compact image representations to un-ordered 2D point cloud. Compared with PointTrack, our proposed PointTrack++ offers three major improvements. Firstly, in the instance segmentation stage, we adopt a semantic segmentation decoder trained with focal loss to improve the instance selection quality. Secondly, to further boost the segmentation performance, we propose a data augmentation strategy by copy-and-paste instances into training images. Finally, we introduce a better training strategy in the instance association stage to improve the distinguishability of learned instance embeddings. The resulting framework achieves the state-of-the-art performance on the 5th BMTT MOTChallenge.

研究动机与目标

  • 解决在边界框严重重叠的拥挤场景中学习可区分实例嵌入的挑战。
  • 通过用语义分割头替代种子图预测,提升 MOTS 中的实例分割质量。
  • 通过为拥挤场景设计的复制粘贴数据增强策略,提升训练泛化能力和分割鲁棒性。
  • 通过分离前景和背景嵌入学习的多阶段训练策略,增强嵌入可区分性。
  • 在在线、端到端框架中,实现在 KITTI MOTS 和 BMTT MOTS 挑战赛基准上的最先进性能。

提出的方法

  • 将 PointTrack 中的种子图分支替换为使用焦点损失训练的语义分割解码器,以提升实例选择质量。
  • 引入一种复制粘贴数据增强策略,将具有相似明度的实例粘贴到训练图像中,以模拟拥挤场景。
  • 为嵌入网络实施多阶段训练策略,第一阶段专注于前景嵌入,第二阶段专注于位置和环境嵌入。
  • 采用基于点云的嵌入网络,将原始图像像素作为无序 2D 点处理,通过多层感知机(MLP)结合位置、颜色和类别特征,学习上下文感知的实例嵌入。
  • 解耦分割与嵌入阶段,使训练期间可灵活使用图像级和视频级标注。
  • 将输入图像上采样至原始尺寸的两倍,以提升特征分辨率和分割精度。

实验结果

研究问题

  • RQ1将种子图预测替换为语义分割头是否能提升 MOTS 中的实例选择与分割质量?
  • RQ2复制粘贴数据增强在提升拥挤场景中实例分割模型泛化能力方面有多有效?
  • RQ3为实例嵌入设计的多阶段训练策略是否能带来更好的可区分性与跟踪性能?
  • RQ4无候选框、基于点云的嵌入网络是否能在 MOTS 中实现优于基于 ROI 方法的跟踪性能?
  • RQ5所提出的改进在 KITTI MOTS 和 BMTT MOTS 等挑战性基准上的性能提升程度如何?

主要发现

  • PointTrack++ 在 KITTI MOTS 测试集上对汽车的 sMOTSA 和 MOTSA 分别达到 86.81% 和 95.95%,相比 PointTrack 提升 4.3%。
  • 对行人,PointTrack++ 在 KITTI 测试集上实现 65.51% sMOTSA 和 81.54% MOTSA,相比 PointTrack 提升 6.6%。
  • 消融实验表明,语义分割头、复制粘贴增强和多阶段训练的组合带来了最大的性能提升。
  • 仅使用语义分割头,行人 sMOTSA 提升 2.15%,证明其在减少误报和漏报方面的有效性。
  • 复制粘贴增强为行人带来 0.52% 的 sMOTSA 提升,表明其在拥挤场景中增强了模型鲁棒性。
  • 与单阶段训练相比,多阶段训练策略使 MOTSA 提升 0.86%,表明嵌入可区分性得到改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。