[论文解读] Tracking by Animation: Unsupervised Learning of Multi-Object Attentive Trackers
本文提出了一种新型无监督、端到端的在线多目标跟踪框架——Tracking-by-Animation (TBA),其通过重建误差进行训练,无需依赖标注的边界框。该方法引入了Reprioritized Attentive Tracking (RAT)机制,显著提升了数据关联的鲁棒性,在合成数据集和真实世界数据集(如DukeMTMC)上均取得了具有竞争力的性能表现,且无需任何监督信号。
Online Multi-Object Tracking (MOT) from videos is a challenging computer vision task which has been extensively studied for decades. Most of the existing MOT algorithms are based on the Tracking-by-Detection (TBD) paradigm combined with popular machine learning approaches which largely reduce the human effort to tune algorithm parameters. However, the commonly used supervised learning approaches require the labeled data (e.g., bounding boxes), which is expensive for videos. Also, the TBD framework is usually suboptimal since it is not end-to-end, i.e., it considers the task as detection and tracking, but not jointly. To achieve both label-free and end-to-end learning of MOT, we propose a Tracking-by-Animation framework, where a differentiable neural model first tracks objects from input frames and then animates these objects into reconstructed frames. Learning is then driven by the reconstruction error through backpropagation. We further propose a Reprioritized Attentive Tracking to improve the robustness of data association. Experiments conducted on both synthetic and real video datasets show the potential of the proposed model. Our project page is publicly available at: https://github.com/zhen-he/tracking-by-animation
研究动机与目标
- 解决需要昂贵边界框标注的监督式、非端到端Tracking-by-Detection (TBD) 方法的局限性。
- 通过消除对标注数据的需求,实现在线多目标跟踪的端到端无监督学习。
- 通过可学习的注意力机制提升在遮挡、外观变化和背景噪声下的数据关联鲁棒性。
- 构建一个可微分的生成式框架,通过反向传播联合优化跟踪与重建过程。
提出的方法
- TBA框架采用可微分神经模型,首先从输入帧中跟踪目标,然后将这些目标动画化生成重建帧。
- 一个特征提取网络使用参数为 θ^feat 的神经网络,将输入帧压缩为低维特征。
- 一组包含 I 个神经跟踪器的跟踪器阵列,维护状态向量 h_t,i,并通过参数为 θ^upd 的神经网络 NN^upd 进行更新,采用一种新颖的Reprioritized Attentive Tracking (RAT)机制。
- 每个跟踪器通过共享输出网络 NN^out 生成输出,包括置信度分数和空间特征等中间表示。
- 渲染器从跟踪器输出重建输入帧,且不包含可学习参数;训练过程通过反向传播整个系统,以像素级重建损失为优化目标。
- RAT引入一种软注意力机制,支持迭代式内存读写,使跟踪器能够基于置信度优先更新内存,从而避免重复跟踪,提升鲁棒性。
实验结果
研究问题
- RQ1能否仅通过重建误差作为唯一学习信号,实现多目标跟踪的端到端无监督学习?
- RQ2在缺乏真实身份标注的情况下,如何提升数据关联的鲁棒性,特别是在遮挡和外观变化场景下?
- RQ3像RAT这样的可学习注意力机制,是否能通过根据置信度和内存状态动态重排跟踪器更新优先级,从而提升跟踪性能?
- RQ4所提出的TBA框架是否能在无需标注边界框的前提下,泛化到合成数据集和真实世界视频数据集?
主要发现
- TBA模型在DukeMTMC数据集上取得了具有竞争力的跟踪性能,IDF1得分为82.4,IDP为86.1,MOTA为79.6,尽管为无监督方法,但在部分指标上仍优于多个监督基线模型。
- 在合成数据集Sprites-MOT和MNIST-MOT上,模型展现出强大的泛化能力,对遮挡和外观变化具有良好的鲁棒性。
- RAT的可视化结果表明,注意力权重能有效清除与已跟踪目标相关的记忆内容,从而防止重复跟踪并提升关联准确性。
- 在DukeMTMC上,TBA在无监督方法中达到最先进性能,成功追踪了1,026个目标(MT),仅有46个目标被大部分丢失(ML),表明其具备出色的长期跟踪稳定性。
- 消融实验验证了RAT显著提升了数据关联的鲁棒性,相比标准注意力机制,有效减少了跟踪中断和过拟合现象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。