Skip to main content
QUICK REVIEW

[论文解读] Progressively Normalized Self-Attention Network for Video Polyp Segmentation

Ge-Peng Ji, Yu-Cheng Chou|arXiv (Cornell University)|May 18, 2021
Advanced Image Processing Techniques参考文献 25被引用 13
一句话总结

该论文提出PNS-Net,一种基于新型归一化自注意力机制的实时视频息肉分割模型,可逐步捕捉长距离时空依赖关系。通过将轻量级、无主干网络的自注意力模块与循环机制及CNN结合,PNS-Net在单张GPU上实现了约140 FPS的SOTA性能,在多个基准测试中优于现有方法,且无需后处理。

ABSTRACT

Existing video polyp segmentation (VPS) models typically employ convolutional neural networks (CNNs) to extract features. However, due to their limited receptive fields, CNNs can not fully exploit the global temporal and spatial information in successive video frames, resulting in false-positive segmentation results. In this paper, we propose the novel PNS-Net (Progressively Normalized Self-attention Network), which can efficiently learn representations from polyp videos with real-time speed (~140fps) on a single RTX 2080 GPU and no post-processing. Our PNS-Net is based solely on a basic normalized self-attention block, equipping with recurrence and CNNs entirely. Experiments on challenging VPS datasets demonstrate that the proposed PNS-Net achieves state-of-the-art performance. We also conduct extensive experiments to study the effectiveness of the channel split, soft-attention, and progressive learning strategy. We find that our PNS-Net works well under different settings, making it a promising solution to the VPS task.

研究动机与目标

  • 为解决基于CNN的模型在结肠镜视频中捕捉全局时空上下文的局限性。
  • 克服标准自注意力机制在实时视频分割中感受野受限和计算成本高的问题。
  • 开发一种轻量级、即插即用的自注意力机制,在不牺牲推理速度的前提下提升息肉分割精度。
  • 验证渐进式学习、通道分割和软注意力机制在提升不同息肉形状与运动模式下分割鲁棒性方面的有效性。

提出的方法

  • PNS-Net的核心是一个归一化自注意力(NS)模块,通过通道归一化计算查询、键和值特征,以稳定训练并提升特征表示能力。
  • NS模块与循环机制(R=2)堆叠,逐步优化视频帧间的特征,实现对长距离时间依赖的有效建模。
  • 采用通道分割策略将特征划分为查询/键/值分支,使模型能够自适应地关注不同速度下的多尺度息肉运动。
  • 将NS模块集成到基于CNN的编码器-解码器架构中,实现端到端训练,全程监督且无需后处理。
  • 引入软注意力机制,动态加权注意力图与特征聚合的重要性,提升特征精炼效果。
  • 采用渐进式学习策略,在训练过程中逐步增加NS模块的数量,稳定优化过程并减少小数据集上的过拟合。

实验结果

研究问题

  • RQ1在视频息肉分割任务中,归一化自注意力机制相较于标准自注意力机制在精度和推理速度方面表现如何?
  • RQ2在结肠镜视频中建模多样化息肉运动模式时,归一化自注意力模块的最佳数量和通道分割数是多少?
  • RQ3软注意力机制与渐进式学习的结合是否能提升小样本和具有挑战性的VPS数据集上的分割性能?
  • RQ4基于自注意力的模型能否在精度和实时推理速度两方面均超越基于CNN的SOTA方法?

主要发现

  • 在CVC-300-TV数据集上,PNS-Net的Dice分数达到最大值0.887,相比之前SOTA方法提升约10%(Dice)。
  • 在CVC-612-T数据集上,PNS-Net的Dice分数为0.860,$S_\alpha$为0.903,所有指标均表现更优。
  • 消融实验表明,R=2的归一化自注意力模块性能最佳,进一步增加模块数量则导致过拟合。
  • 与硬注意力变体相比,软注意力机制使$S_\alpha$和$E_\phi$的性能提升0.01–0.02。
  • 通道分割中N=4的设置在捕捉局部运动与全局上下文之间达到最佳平衡,优于更小或更大的分割数。
  • PNS-Net在单张RTX 2080 GPU上运行速度约为140 FPS,证实其无需后处理即可实现实时推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。