[论文解读] XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model
XMem 提出了一种用于长时视频目标分割的多存储记忆架构,受 Atkinson-Shiffrin 记忆模型启发,整合了感觉记忆、工作记忆和长期记忆存储,并引入记忆增强与整合机制。该方法在长视频基准测试中达到最先进性能,同时在短视频上保持高精度,GPU 显存占用极低,并具备实时推理能力。
We present XMem, a video object segmentation architecture for long videos with unified feature memory stores inspired by the Atkinson-Shiffrin memory model. Prior work on video object segmentation typically only uses one type of feature memory. For videos longer than a minute, a single feature memory model tightly links memory consumption and accuracy. In contrast, following the Atkinson-Shiffrin model, we develop an architecture that incorporates multiple independent yet deeply-connected feature memory stores: a rapidly updated sensory memory, a high-resolution working memory, and a compact thus sustained long-term memory. Crucially, we develop a memory potentiation algorithm that routinely consolidates actively used working memory elements into the long-term memory, which avoids memory explosion and minimizes performance decay for long-term prediction. Combined with a new memory reading mechanism, XMem greatly exceeds state-of-the-art performance on long-video datasets while being on par with state-of-the-art methods (that do not work on long videos) on short-video datasets. Code is available at https://hkchengrex.github.io/XMem
研究动机与目标
- 解决现有视频目标分割方法依赖单一特征记忆存储所导致的可扩展性限制,该问题引发高 GPU 显存占用和长视频中性能下降。
- 在长视频(例如比标准基准长 3 倍)上实现准确、实时且内存高效的视频目标分割,同时不牺牲短视频上的性能。
- 开发一种生物启发的记忆架构,通过独立但相互连接的特征记忆存储,模拟人类的记忆过程——感觉记忆、工作记忆和长期记忆。
- 设计一种记忆增强与整合算法,实现在紧凑且高保真度的长期记忆存储中,同时防止记忆爆炸和表征漂移。
提出的方法
- XMem 采用三种独立的特征记忆存储:基于 GRU 的快速更新感觉记忆、聚合历史帧的高分辨率工作记忆,以及用于持久存储的紧凑长期记忆。
- 一种记忆增强算法通过聚合更丰富、多尺度的特征,在将选定原型存入长期记忆前进行增强,从而减少下采样带来的混叠效应。
- 一种记忆整合机制基于使用统计信息,定期将活跃的工作记忆元素转移至长期记忆,确保长期保留的同时避免显存过度增长。
- 一种时空记忆读取机制通过注意力机制实现查询帧与工作记忆及长期记忆存储之间的特征匹配,采用各向异性 L2 相似度,并引入选择与压缩项。
- 每 r 幅帧对感觉记忆执行深度更新,以维持时间一致性并减少漂移,计算开销极低。
- 模型采用双分支网络结构,包含一个特征编码器和一个掩码头,记忆存储以在线流式方式更新与读取。
实验结果
研究问题
- RQ1受人类认知启发的多存储记忆架构是否能在保持低内存消耗的同时,提升长期视频目标分割的准确性?
- RQ2与单记忆基线相比,感觉记忆、工作记忆和长期记忆存储的整合在长视频上的性能表现如何?
- RQ3记忆增强与整合在多大程度上提升了长期记忆的保真度,并减少了长视频序列中的性能衰减?
- RQ4统一的记忆架构是否能在不牺牲推理速度或内存效率的前提下,同时在短视频和长视频基准上实现最先进性能?
主要发现
- 在 Long-time Video (3×) 数据集上,XMem 达到 90.0 ± 0.4 的 J&F 得分,显著优于以往最先进方法在长视频上的表现。
- 在标准 DAVIS 2017 基准上,XMem 达到 89.8 ± 0.2 的 J&F 得分,与无法扩展至长视频的顶尖方法性能相当。
- 基于使用频率的原型选择与特征增强的记忆增强算法,显著提升了长期记忆质量,相比非增强基线性能提升 2.1%。
- 采用 P=128 原型的基于使用频率的选择策略实现性能与内存压缩的最佳平衡,优于随机、k-means 和局部窗口策略。
- 结合各向异性 L2 相似度与双尺度项(选择与压缩)的时空记忆读取机制,提升了注意力的准确性和鲁棒性,消融实验表明两组件间存在协同效应。
- 每 r 幅帧执行一次深度更新可使性能提升 0.5–1.0 J&F 分,且速度影响可忽略,证实其在维持感觉记忆质量方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。