[论文解读] RPT: Learning Point Set Representation for Siamese Visual Tracking
该论文提出RPT,一种新型的孪生视觉追踪框架,用可学习的代表性点集替代传统的边界框表示,以实现更精细的目标定位。通过利用多层级特征聚合与在线训练的分类分支,RPT在OTB2015、VOT2018、VOT2019和GOT-10k上均取得最先进性能,推理速度超过20 FPS。
While remarkable progress has been made in robust visual tracking, accurate target state estimation still remains a highly challenging problem. In this paper, we argue that this issue is closely related to the prevalent bounding box representation, which provides only a coarse spatial extent of object. Thus an effcient visual tracking framework is proposed to accurately estimate the target state with a finer representation as a set of representative points. The point set is trained to indicate the semantically and geometrically significant positions of target region, enabling more fine-grained localization and modeling of object appearance. We further propose a multi-level aggregation strategy to obtain detailed structure information by fusing hierarchical convolution layers. Extensive experiments on several challenging benchmarks including OTB2015, VOT2018, VOT2019 and GOT-10k demonstrate that our method achieves new state-of-the-art performance while running at over 20 FPS.
研究动机与目标
- 解决边界框表示在视觉追踪中的局限性,其仅提供粗略的空间范围,缺乏几何细节。
- 通过建模一组语义与几何上显著的代表性点,提升目标状态估计的准确性。
- 通过在线训练的分类分支,增强对干扰项与外观变化的鲁棒性。
- 通过多层级聚合策略融合分层卷积特征,实现更精细的定位。
- 在多个基准上实现最先进性能,同时保持实时推理速度(>20 FPS)。
提出的方法
- 提出点集表示,用于编码目标的空间范围与关键结构位置,替代标准边界框。
- 设计一个孪生网络,包含两个并行分支:一个用于离线学习的点集预测,另一个用于在线判别性特征学习。
- 实现一种多层级聚合策略,融合来自多个卷积层的特征,以捕捉详细的结构信息。
- 训练点集头以预测从锚点到代表性目标位置的相对偏移,实现在无需预设锚框情况下的精确定位。
- 使用可学习的嵌入空间表示点集,支持端到端训练与标准反向传播。
- 将点集预测与分割头(通过D3S适配)结合,用于在VOT2020上基于掩码标注进行评估。
实验结果
研究问题
- RQ1与边界框回归相比,可学习的点集表示是否能提升孪生视觉追踪中目标状态估计的准确性?
- RQ2多层级特征聚合如何提升视觉追踪中的定位精度与结构建模能力?
- RQ3用点集表示替代基于锚框的回归,是否能提升在外观与几何变化下的泛化能力与鲁棒性?
- RQ4在线分类分支在复杂追踪场景中,能在多大程度上增强判别能力?
- RQ5所提方法是否能在标准基准上实现最先进性能,同时保持实时推理速度(>20 FPS)?
主要发现
- 在OTB2015上,RPT取得新的SOTA AUC分数0.715,相比基线SiamFC++(ResNet-50)的0.675提升4.0%。
- 在VOT2018上,RPT在鲁棒性(R=0.103)与EAO(0.510)两项指标上均达到最高,优于DRNet与D3S。
- 在VOT2019上,RPT取得EAO 0.417与准确率0.623,优于DRNet(EAO: 0.395)及其他SOTA方法。
- 消融实验表明,每个组件——点集表示、在线分类分支与多层级聚合——均对性能有逐步贡献,仅点集表示一项即带来+2.5%的AUC提升。
- 在VOT2020上基于分割掩码评估,增强版RPT框架取得EAO 0.539,表明其在新评估协议下表现强劲。
- 该方法在所有基准上均实现超过20 FPS的推理速度,证实其具备实时推理能力且不损失精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。