[论文解读] SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
SpikeMba 提出了一种新颖的多模态脉冲显著性 Mamba 网络,用于时序视频定位,通过脉冲神经网络(SNNs)实现动态显著性提议检测,并引入可学习的相关槽以增强长序列记忆。该模型在 QVHighlights 测试集上达到最先进性能,R1 为 85.6%,mAP 为 75.5%,通过改进上下文推理和显著性定位优于先前方法。
Temporal video grounding (TVG) is a critical task in video content understanding, requiring precise alignment between video content and natural language instructions. Despite significant advancements, existing methods face challenges in managing confidence bias towards salient objects and capturing long-term dependencies in video sequences. To address these issues, we introduce SpikeMba: a multi-modal spiking saliency mamba for temporal video grounding. Our approach integrates Spiking Neural Networks (SNNs) with state space models (SSMs) to leverage their unique advantages in handling different aspects of the task. Specifically, we use SNNs to develop a spiking saliency detector that generates the proposal set. The detector emits spike signals when the input signal exceeds a predefined threshold, resulting in a dynamic and binary saliency proposal set. To enhance the model's capability to retain and infer contextual information, we introduce relevant slots which learnable tensors that encode prior knowledge. These slots work with the contextual moment reasoner to maintain a balance between preserving contextual information and exploring semantic relevance dynamically. The SSMs facilitate selective information propagation, addressing the challenge of long-term dependency in video content. By combining SNNs for proposal generation and SSMs for effective contextual reasoning, SpikeMba addresses confidence bias and long-term dependencies, thereby significantly enhancing fine-grained multimodal relationship capture. Our experiments demonstrate the effectiveness of SpikeMba, which consistently outperforms state-of-the-art methods across mainstream benchmarks.
研究动机与目标
- 解决视频定位中对显著对象的置信偏差问题,即模型忽略细微但语义相关的动作。
- 通过增强记忆容量并有效建模长期依赖关系,克服长视频序列的局限性。
- 通过利用脉冲神经网络检测细粒度显著性提议,改进多模态特征融合。
- 通过具有自适应相关槽的上下文时刻推理器,平衡上下文信息保留与语义相关性探索。
- 通过使用高效的状态空间模型(SSMs)降低计算成本,同时在时序视频定位中保持高性能。
提出的方法
- 提出一种基于 SNNs 的脉冲显著性检测器,通过阈值机制生成二值脉冲序列,实现动态、时间步自适应的提议生成。
- 提出相关槽——可学习张量,用于编码先验知识并选择性地表示多层级多模态特征,以增强长视频的记忆能力。
- 设计一种上下文时刻推理器(CMR),利用相关槽在上下文保留与语义相关性探索之间取得平衡。
- 采用基于状态空间模型(SSMs)的多模态相关 Mamba 模块,以线性复杂度建模长程依赖关系。
- 集成对比损失和显著性提议损失,以优化特征表示并提高提议准确性。
- 在 SSM 中采用动态参数化,根据输入自适应地传播或遗忘信息,提升对相关视频片段的响应能力。

实验结果
研究问题
- RQ1脉冲神经网络能否在多模态视频定位任务中有效检测细粒度显著性提议?
- RQ2可学习的相关槽在长视频序列中如何提升记忆容量和上下文理解能力?
- RQ3上下文时刻推理器在视频定位中在多大程度上平衡了语义相关性与上下文保留?
- RQ4SNN 与 SSM 的集成是否在准确性和效率方面优于传统的 Transformer 基模型?
- RQ5不同的脉冲时间步长和损失组件如何影响模型在基准数据集上的性能?
主要发现
- SpikeMba 在 QVHighlights 测试集上达到 85.6% 的 Recall@0.5 和 75.5% 的 mAP,优于最先进方法。
- 消融实验表明,移除上下文时刻推理器(CMR)会使测试集上的 mAP(Avg.)降至 35.46%,凸显其在语义推理中的关键作用。
- 与无 SSD 的基线相比,脉冲显著性检测器使 mAP(Avg.)提升 4.8%,证明其在显著性定位中的有效性。
- 将脉冲时间步长从 T=4 增加到 T=8,使 mAP(Avg.)从 42.03% 提升至 44.81%,表明更高时间步分辨率可改善时间处理能力。
- 移除对比损失会使测试集上的 mAP(Avg.)降至 41.70%,证实其在学习判别性特征表示中的重要性。
- 引入相关槽的模型优于无相关槽的变体,尤其在更高时间步长下表现更优,证明其在复杂时间推理中的价值。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。