[论文解读] IA-MOT: Instance-Aware Multi-Object Tracking with Motion Consistency
本文提出 IA-MOT,一种新颖的实例感知多目标跟踪框架,通过融合实例级特征与运动一致性来提升跟踪精度。该方法利用改进的 Mask R-CNN 模型(配备嵌入头和空间注意力机制)提取前景感知特征,并结合匈牙利匹配算法、短期检索与 ReID 模块以处理遮挡问题。在 BMTT Challenge 2020 的 Track 3 中,IA-MOT 在 MOTS20 与 KITTI-MOTS 数据集的联合测试中取得了 69.8 sMOTSA 的得分,位列第一。
Multiple object tracking (MOT) is a crucial task in computer vision society. However, most tracking-by-detection MOT methods, with available detected bounding boxes, cannot effectively handle static, slow-moving and fast-moving camera scenarios simultaneously due to ego-motion and frequent occlusion. In this work, we propose a novel tracking framework, called "instance-aware MOT" (IA-MOT), that can track multiple objects in either static or moving cameras by jointly considering the instance-level features and object motions. First, robust appearance features are extracted from a variant of Mask R-CNN detector with an additional embedding head, by sending the given detections as the region proposals. Meanwhile, the spatial attention, which focuses on the foreground within the bounding boxes, is generated from the given instance masks and applied to the extracted embedding features. In the tracking stage, object instance masks are aligned by feature similarity and motion consistency using the Hungarian association algorithm. Moreover, object re-identification (ReID) is incorporated to recover ID switches caused by long-term occlusion or missing detection. Overall, when evaluated on the MOTS20 and KITTI-MOTS dataset, our proposed method won the first place in Track 3 of the BMTT Challenge in CVPR2020 workshops.
研究动机与目标
- 为解决基于检测的跟踪方法在频繁遮挡场景下应对静态与动态相机情况的局限性。
- 通过在特征提取中整合实例分割掩码,降低背景噪声,提升跟踪鲁棒性。
- 通过联合考虑目标尺寸、方向与速度,改进运动一致性建模,以优化轨迹关联。
- 通过短期检索与 ReID 模块减少 ID 切换并恢复丢失的检测结果。
- 在涵盖静态与动态相机场景的多样化 MOTS 基准数据集上实现最先进性能。
提出的方法
- 训练一个改进的 Mask R-CNN 模型,增加一个嵌入头,通过多任务损失函数端到端联合优化检测、分割与特征嵌入。
- 从预测的实例掩码生成空间注意力图,并将其应用于加权嵌入特征中的前景区域,以增强实例感知能力。
- 在线跟踪采用匈牙利算法,基于掩码 IoU、嵌入特征余弦相似度与运动一致性联合关联检测结果。
- 通过短时窗口内目标轨迹计算的运动向量建模运动一致性,使用余弦相似度匹配轨迹。
- 短期检索(STR)模块通过在时间窗口内重新关联孤立检测,恢复丢失的检测结果。
- 对长期遮挡情况应用目标重识别(ReID),通过跨长间隔匹配特征解决 ID 切换问题。
实验结果
研究问题
- RQ1能否通过分割掩码生成的实例感知特征,提升在存在遮挡与相机运动复杂场景下的跟踪鲁棒性?
- RQ2如何有效建模运动一致性(涵盖速度、方向与尺寸),以提升基于检测框架中的轨迹关联性能?
- RQ3短期检索与 ReID 模块在多大程度上可减少 ID 切换并恢复长期遮挡下的丢失检测?
- RQ4统一框架是否能在 MOTS20 与 KITTI-MOTS 等具有不同相机动态与目标类型的多样化数据集上实现优异性能?
- RQ5与基于标准边界框的特征提取相比,空间注意力与实例级特征的融合在 MOTS 中表现如何?
主要发现
- IA-MOT 在 MOTS20 与 KITTI-MOTS 数据集的联合测试中取得了 69.8 sMOTSA 的得分,荣获 2020 年 BMTT Challenge Track 3 冠军。
- 在 MOTS20 数据集上,IA-MOT 仅使用公开检测结果即达到 69.4 sMOTSA,几乎与使用私有检测器的最佳方法性能相当。
- 在 KITTI-MOTS 数据集中,IA-MOT 在车辆跟踪任务中位列第 3 名,在行人跟踪任务中位列第 5 名,展现出在不同目标类别间的强大泛化能力。
- 空间注意力机制的引入通过突出前景内容并减少嵌入特征中的背景噪声,显著提升了特征质量。
- 运动一致性模块显著提升了轨迹关联的准确性,尤其在高密度目标与频繁遮挡的场景中表现突出。
- 短期检索与 ReID 模块的结合有效减少了 ID 切换并恢复了丢失的检测结果,尤其在长期遮挡情况下效果显著。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。