[论文解读] LightTrack: Finding Lightweight Neural Networks for Object Tracking via One-Shot Architecture Search
LightTrack 提出了一种一次性神经架构搜索(NAS)框架,用于自动设计轻量化、高性能的目标追踪器。通过在 ImageNet 和追踪数据上预训练的超网络中联合搜索主干网络和头部网络架构,LightTrack 发现的模型在 FLOPs 减少高达 98.9%、参数量减少 13 倍的情况下,实现了最先进(SOTA)的 EAO 性能,显著优于 SiamRPN++ 和 Ocean 等 SOTA 追踪器,使其能够在移动设备和边缘设备上实现实时推理。
Object tracking has achieved significant progress over the past few years. However, state-of-the-art trackers become increasingly heavy and expensive, which limits their deployments in resource-constrained applications. In this work, we present LightTrack, which uses neural architecture search (NAS) to design more lightweight and efficient object trackers. Comprehensive experiments show that our LightTrack is effective. It can find trackers that achieve superior performance compared to handcrafted SOTA trackers, such as SiamRPN++ and Ocean, while using much fewer model Flops and parameters. Moreover, when deployed on resource-constrained mobile chipsets, the discovered trackers run much faster. For example, on Snapdragon 845 Adreno GPU, LightTrack runs $12 imes$ faster than Ocean, while using $13 imes$ fewer parameters and $38 imes$ fewer Flops. Such improvements might narrow the gap between academic models and industrial deployments in object tracking task. LightTrack is released at https://github.com/researchmm/LightTrack.
研究动机与目标
- 解决最先进目标追踪器日益增长的模型复杂度和计算成本问题,这些问题阻碍了其在移动设备和无人机等资源受限环境中的部署。
- 克服模型压缩技术(如剪枝、量化)因信息损失而导致性能下降的局限性。
- 减少对耗时且非最优的专家设计、手工构造架构的依赖,以满足追踪任务的特定需求。
- 开发一种自动化、高效的搜索方法,用于发现专为目标追踪定制的紧凑且高性能的神经架构。
- 通过最小化 FLOPs 和参数量,在不牺牲准确率的前提下,实现深度追踪模型在边缘硬件上的实时部署。
提出的方法
- 为追踪任务专门设计一次性 NAS 框架,使用在 ImageNet 上预训练并在追踪数据上微调的主干超网络,以及直接在追踪数据上训练的头部超网络。
- 通过使用深度可分离卷积(DSConv)和移动端倒残差(MBConv)模块构建轻量化搜索空间,以支持高效的架构搜索。
- 仅训练一次主干和头部超网络,随后直接继承权重用于架构评估,从而实现快速高效的搜索。
- 以追踪精度和模型复杂度(FLOPs、参数量)作为多目标监督信号,执行架构搜索。
- 结合 ImageNet 预训练与追踪特定的微调,以保留特征表示能力的同时优化定位精度。
- 采用基于超网络的搜索流程,支持参数共享的可微架构搜索,降低搜索成本并提升收敛性。
实验结果
研究问题
- RQ1一次性 NAS 是否可有效适配于目标追踪任务,以自动发现轻量化、高性能的架构?
- RQ2NAS 发现的追踪器在准确率和效率方面与手工设计的 SOTA 追踪器相比表现如何?
- RQ3ImageNet 预训练在多大程度上提升了所搜索架构的最终追踪性能?
- RQ4在目标追踪背景下,NAS 检测到的架构模式是什么?这些模式是否与已知的设计原则一致?
- RQ5所搜索的追踪器是否能在移动和边缘硬件上实现实时推理,同时保持具有竞争力的准确率?
主要发现
- LightTrack 发现的 530M FLOPs 追踪器在 VOT-19 基准上实现了 0.333 的 EAO,较 SiamRPN++(0.287)提升 4.6%,同时 FLOPs 减少 98.9%。
- 在高通骁龙 845 Adreno 630 GPU 上,LightTrack 推理速度达到 12× 快于 Ocean(3.2 fps vs. 38.4 fps),参数量减少 13 倍(1.97M vs. 25.9M),FLOPs 减少 38 倍(530M vs. 20.3G)。
- ImageNet 预训练显著提升追踪性能:EAO 从无预训练时的 21.3% 提升至 500 个周期预训练后的 33.3%。
- 所搜索的主干网络在约 50% 的块中使用 7×7 MBConv 块,表明大感受野对定位精度具有优势。
- 最优特征输出层位于倒数第二层,表明追踪网络可能更受益于中层特征而非高层表示。
- 分类分支比回归分支更浅,反映出粗略定位相较于精确边界框回归更具挑战性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。