Skip to main content
QUICK REVIEW

[论文解读] Object Tracking by Jointly Exploiting Frame and Event Domain

Jiqing Zhang, Xin Yang|arXiv (Cornell University)|Sep 19, 2021
Video Surveillance and Tracking Methods参考文献 47被引用 4
一句话总结

本论文提出了一种新颖的帧-事件融合框架,通过联合利用事件相机的高动态范围和时间分辨率与帧相机的丰富纹理信息,实现了鲁棒的单目标跟踪。通过使用跨域注意力机制和自适应加权,该方法在基准数据集上实现了最先进性能,成功率达到88.7%,精度率达到84.1%,优于仅使用帧的最先进方法10.4%(成功率)和11.9%(精度率),并引入了一个新的大规模FE108数据集用于评估。

ABSTRACT

Inspired by the complementarity between conventional frame-based and bio-inspired event-based cameras, we propose a multi-modal based approach to fuse visual cues from the frame- and event-domain to enhance the single object tracking performance, especially in degraded conditions (e.g., scenes with high dynamic range, low light, and fast-motion objects). The proposed approach can effectively and adaptively combine meaningful information from both domains. Our approach's effectiveness is enforced by a novel designed cross-domain attention schemes, which can effectively enhance features based on self- and cross-domain attention schemes; The adaptiveness is guarded by a specially designed weighting scheme, which can adaptively balance the contribution of the two domains. To exploit event-based visual cues in single-object tracking, we construct a large-scale frame-event-based dataset, which we subsequently employ to train a novel frame-event fusion based model. Extensive experiments show that the proposed approach outperforms state-of-the-art frame-based tracking methods by at least 10.4% and 11.9% in terms of representative success rate and precision rate, respectively. Besides, the effectiveness of each key component of our approach is evidenced by our thorough ablation study.

研究动机与目标

  • 解决帧跟踪在高动态范围、低光照和快速运动等退化条件下性能受限的问题。
  • 利用帧相机与事件相机的互补优势,提升跟踪鲁棒性。
  • 设计一种多模态融合框架,根据场景可靠性自适应地结合来自两种模态的视觉线索。
  • 构建一个大规模、高频的帧-事件数据集(FE108),以支持未来多模态目标跟踪研究。
  • 通过广泛的消融实验与基准测试,验证所提出的基于注意力的融合机制与自适应加权机制的有效性。

提出的方法

  • 提出一种时间离散化的事件聚合方法,将异步事件流转换为伪帧以供CNN处理,使用$ n=3 $个时间片作为准确率与效率之间的最佳权衡。
  • 设计一种跨域特征整合器(CDMS),结合自注意力与交叉注意力机制,融合来自帧域与事件域的特征。
  • 引入边缘感知分支(EAB),增强事件流中的边缘特征,提升对目标边界的检测能力。
  • 实现一种自适应加权方案,根据每帧场景中特征的可靠性动态调整帧与事件特征的贡献。
  • 使用新构建的FE108数据集端到端训练模型,该数据集包含108个视频序列、1.5小时的数据,帧率最高达40Hz(帧),事件频率最高达240Hz(事件)。
  • 通过可学习的加权机制优化事件聚合,优于固定权重基线方法。

实验结果

研究问题

  • RQ1能否通过联合利用帧域与事件域显著提升在高动态范围与快速运动等挑战性条件下的跟踪性能?
  • RQ2在基于CNN的跟踪框架中,如何有效转换并融合异步事件数据与同步帧数据?
  • RQ3跨域注意力机制在利用两域互补线索的基础上,能在多大程度上增强特征表示?
  • RQ4自适应加权方案如何通过基于场景特定可靠性的动态平衡帧与事件贡献,提升鲁棒性?
  • RQ5事件聚合策略与时间切片粒度对跟踪准确率与推理速度有何影响?

主要发现

  • 所提方法在OTB-100基准测试中取得88.7%的成功率与84.1%的精度率,优于最佳帧仅SOTA方法10.4%(成功率)与11.9%(精度率)。
  • 消融实验表明,若移除跨域多尺度注意力模块(CDMS),性能下降最大,凸显其在特征融合中的关键作用。
  • 自适应加权方案显著提升鲁棒性:在帧质量较差的场景中,模型会赋予事件特征更高权重(例如$ w_e > w_f $),反之亦然。
  • 采用$ n=3 $个时间片的事件聚合方法在准确率与速度之间达到最佳平衡,实现92.4%的RPR与63.4%的RSR,推理速度达30.1 FPS。
  • FE108数据集包含108个视频序列,事件标注频率最高达240Hz,是迄今最大规模、时间分辨率最高的帧-事件跟踪数据集。
  • 模型在全部八个具有挑战性的视觉示例中成功跟踪目标,包括帧域中无纹理的场景,此时仅事件数据提供有效线索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。