[论文解读] Temporally Distributed Networks for Fast Video Semantic Segmentation
TDNet 是一种时序分布网络,通过使用轻量级子网络在连续帧之间分配特征计算,从而加速视频语义分割,同时利用注意力传播模块补偿运动引起的错位,并通过分组知识蒸馏损失增强特征表示。在 Cityscapes、CamVid 和 NYUD-v2 上,其准确率达到当前最先进水平,且延迟低于先前方法的 2 倍以上。
We present TDNet, a temporally distributed network designed for fast and accurate video semantic segmentation. We observe that features extracted from a certain high-level layer of a deep CNN can be approximated by composing features extracted from several shallower sub-networks. Leveraging the inherent temporal continuity in videos, we distribute these sub-networks over sequential frames. Therefore, at each time step, we only need to perform a lightweight computation to extract a sub-features group from a single sub-network. The full features used for segmentation are then recomposed by application of a novel attention propagation module that compensates for geometry deformation between frames. A grouped knowledge distillation loss is also introduced to further improve the representation power at both full and sub-feature levels. Experiments on Cityscapes, CamVid, and NYUD-v2 demonstrate that our method achieves state-of-the-art accuracy with significantly faster speed and lower latency.
研究动机与目标
- 解决基于深度学习的视频语义分割在实时应用中计算成本高、延迟大的问题。
- 利用视频中的时序连续性,减少冗余计算,同时保持高准确率。
- 克服关键帧方法中因运动导致的帧间空间错位问题。
- 通过知识蒸馏和分布式子网络提升轻量级模型的特征表示能力。
- 在速度、准确率和计算效率之间实现优于现有视频分割方法的更好权衡。
提出的方法
- 将深层图像分割模型的高层特征分布到 N 个浅层子网络中,每个子网络处理一组不同的特征。
- 将子网络循环分配给连续帧,使得每帧仅计算一个子网络,从而降低每帧的计算量。
- 通过一种新型注意力传播模块,聚合前序帧的子特征,重建每帧的完整特征,该模块可处理几何形变。
- 引入分组知识蒸馏损失,将完整深层模型的知识同时传递给分布式网络的完整特征和子特征层级。
- 对注意力图使用步长为 n 的空间最大池化进行下采样,降低计算量,同时保留空间上下文信息。
- 使用共享或独立的子网络,以评估特征多样性与表示能力对性能的影响。
实验结果
研究问题
- RQ1是否可以将深层视频分割模型中的特征计算分布到不同帧上,从而在不损失准确率的前提下降低每帧延迟?
- RQ2基于注意力的模块在多大程度上能有效补偿视频帧间因运动导致的空间错位?
- RQ3在完整特征和子特征层级同时进行知识蒸馏,能在多大程度上提升分布式网络的性能?
- RQ4使用独立子网络而非共享子网络,是否能增强表示能力与分割准确率?
- RQ5在注意力模块中选择不同的下采样步长,如何影响效率与准确率之间的权衡?
主要发现
- TDNet 在 Cityscapes、CamVid 和 NYUD-v2 上均达到最先进性能,mIoU 分别为 76.8%、76.5% 和 38.2%,优于先前方法。
- TD 4 -PSP18 变体在 Cityscapes 上实现 76.8% 的 mIoU,延迟仅 85ms,显著快于实时基线方法如 LadderNet 和 GUNet。
- 与共享子网络相比,使用独立子网络在 Cityscapes 上将 mIoU 提升 1%,且未增加计算成本,证明了更强的表示能力。
- 注意力传播模块实现了鲁棒的帧间特征聚合,可视化结果表明其能有效匹配时间维度上的语义特征,即使存在运动。
- 将注意力图以步长 n=4 下采样,可使延迟降低 35%(从 268ms 降至 85ms),mIoU 仅下降 0.1%,展现出显著的效率提升。
- 消融实验表明,若移除任意一条子特征路径,准确率均出现一致下降,证明了分布式特征计算的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。