Skip to main content
QUICK REVIEW

[论文解读] Revisiting Color-Event based Tracking: A Unified Network, Dataset, and Metric

Chuanming Tang, Xiao Wang|arXiv (Cornell University)|Nov 20, 2022
Advanced Memory and Neural Computing被引用 14
一句话总结

该论文提出CEUTrack,一种统一的单阶段跟踪网络,通过体素化事件表示和共享视觉Transformer主干网络,联合处理彩色图像与事件数据,实现超过75 FPS的实时性能和最先进精度。该工作引入了大规模COESOT数据集,包含90类共1354个视频序列,并提出一种新指标(BOC),以更好地评估在不同难度水平下的跟踪鲁棒性。

ABSTRACT

Combining the Color and Event cameras (also called Dynamic Vision Sensors, DVS) for robust object tracking is a newly emerging research topic in recent years. Existing color-event tracking framework usually contains multiple scattered modules which may lead to low efficiency and high computational complexity, including feature extraction, fusion, matching, interactive learning, etc. In this paper, we propose a single-stage backbone network for Color-Event Unified Tracking (CEUTrack), which achieves the above functions simultaneously. Given the event points and RGB frames, we first transform the points into voxels and crop the template and search regions for both modalities, respectively. Then, these regions are projected into tokens and parallelly fed into the unified Transformer backbone network. The output features will be fed into a tracking head for target object localization. Our proposed CEUTrack is simple, effective, and efficient, which achieves over 75 FPS and new SOTA performance. To better validate the effectiveness of our model and address the data deficiency of this task, we also propose a generic and large-scale benchmark dataset for color-event tracking, termed COESOT, which contains 90 categories and 1354 video sequences. Additionally, a new evaluation metric named BOC is proposed in our evaluation toolkit to evaluate the prominence with respect to the baseline methods. We hope the newly proposed method, dataset, and evaluation metric provide a better platform for color-event-based tracking. The dataset, toolkit, and source code will be released on: \url{https://github.com/Event-AHU/COESOT}.

研究动机与目标

  • 解决现有彩色-事件跟踪框架中多阶段处理导致的效率低下和复杂度高的问题,这些框架依赖于独立的特征提取、特征融合和匹配模块。
  • 设计一种单阶段、端到端可训练的跟踪网络,将彩色与事件处理统一于共享主干网络中,以提升效率与性能。
  • 缓解彩色-事件跟踪领域缺乏大规模、高质量基准的问题,通过引入包含多样化真实世界序列的COESOT数据集。
  • 通过提出一种新指标(BOC),在标准IoU指标之外,综合考虑帧的难度和目标显著性,以改进评估方法。
  • 提供一个全面的开源平台,包含代码、数据集和工具,以加速基于彩色-事件的视觉跟踪研究。

提出的方法

  • 将原始事件流转换为体素表示,以保留时空动态特性,实现高效处理。
  • 从彩色帧和事件体素中裁剪出对齐的模板区域和搜索区域补丁,以保持空间一致性。
  • 将裁剪后的区域投影为可学习的token,并输入到统一的视觉Transformer主干网络中,通过自适应适配器实现跨模态特征交互。
  • 使用轻量级跟踪头,直接从统一的特征表示中预测边界框。
  • 采用体素顶选策略处理密集事件流,在推理阶段降低计算负载。
  • 引入一种新评估指标BOC(边界框显著性),基于帧的难度和目标可见性来衡量跟踪性能。

实验结果

研究问题

  • RQ1统一的单阶段网络是否能有效替代多阶段融合流水线,在提升速度与精度的同时实现彩色-事件跟踪?
  • RQ2与事件计数、重建等其他事件格式相比,体素化事件表示在跟踪性能和效率方面表现如何?
  • RQ3与现有基准相比,所提出的COESOT数据集在多大程度上提升了彩色-事件跟踪器的评估能力?
  • RQ4与标准IoU指标相比,新提出的BOC指标是否更准确地反映了真实世界中的跟踪难度?
  • RQ5当前彩色-事件跟踪器的主要失败模式是什么?如何通过网络架构和训练策略的改进加以缓解?

主要发现

  • CEUTrack在标准硬件上实现超过75 FPS的推理速度,证明了其在实时性方面的优势,显著优于此前方法(低于20 FPS)。
  • 所提出的CEUTrack在COESOT基准上达到新的最先进性能,在平均精度和复杂序列下的鲁棒性方面均优于现有跟踪器。
  • COESOT数据集包含90类共1354个视频序列,涵盖快速运动、遮挡、低光照和过曝等多种挑战,为未来研究提供了全面的基准。
  • 新提出的BOC指标通过测量预测边界框相对于干扰物和背景杂波的显著性,有效捕捉了跟踪难度,提供了比标准IoU更细致的评估方式。
  • 失败分析显示,CEUTrack在相似干扰物和密集物体场景下表现较弱,表明未来工作需增强抗干扰机制。
  • 数据集包含多种事件表示格式(计数、重建、时间面、体素)和原始.aedat4文件,支持灵活实验和未来方法开发。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。