Skip to main content
QUICK REVIEW

[论文解读] BARNet: Bilinear Attention Network with Adaptive Receptive Fields for Surgical Instrument Segmentation

Zhen-Liang Ni, Gui‐Bin Bian|arXiv (Cornell University)|Jan 20, 2020
Medical Imaging and Analysis参考文献 17被引用 5
一句话总结

该论文提出BARNet,一种具有自适应感受野的双线性注意力网络,用于外科手术器械分割,解决了内窥镜图像中光照和尺度变化的问题。通过双线性池化建模全局语义依赖,并利用通道注意力动态选择多尺度特征,BARNet在Cata7数据集上达到97.47%的平均IOU,在EndoVis 2017数据集上达到64.30%的平均IOU,后者的性能优于之前方法超过10个百分点的IOU。

ABSTRACT

Surgical instrument segmentation is extremely important for computer-assisted surgery. Different from common object segmentation, it is more challenging due to the large illumination and scale variation caused by the special surgical scenes. In this paper, we propose a novel bilinear attention network with adaptive receptive field to solve these two challenges. For the illumination variation, the bilinear attention module can capture second-order statistics to encode global contexts and semantic dependencies between local pixels. With them, semantic features in challenging areas can be inferred from their neighbors and the distinction of various semantics can be boosted. For the scale variation, our adaptive receptive field module aggregates multi-scale features and automatically fuses them with different weights. Specifically, it encodes the semantic relationship between channels to emphasize feature maps with appropriate scales, changing the receptive field of subsequent convolutions. The proposed network achieves the best performance 97.47% mean IOU on Cata7 and comes first place on EndoVis 2017 by 10.10% IOU overtaking second-ranking method.

研究动机与目标

  • 解决内窥镜外科场景中大范围光照变化带来的挑战,该变化会扭曲器械的颜色和纹理。
  • 克服因相机移动和器械方向变化导致的显著尺度变化,从而引起形状和大小改变。
  • 通过全局上下文建模,改善镜面反射和阴影区域的语义特征表示。
  • 开发一种机制,自适应地选择并融合多尺度特征,以实现对不同尺寸器械的鲁棒分割。
  • 在外科手术器械分割的基准数据集上实现最先进性能。

提出的方法

  • 双线性注意力模块(BAM)利用双线性池化建模第二阶特征统计量,以捕捉局部像素与全局上下文之间的复杂语义依赖关系。
  • BAM生成的注意力图具有空间自适应性,使每个像素能够关注全局上下文,从而提升低对比度或反光区域的特征表示能力。
  • 自适应感受野(ARF)模块学习通道间的语义关系,以选择适合后续卷积操作的适当尺度特征图。
  • ARF通过跨尺度的密集跳跃连接融合多尺度特征,实现对广泛器械尺寸范围的覆盖。
  • 基于学习到的注意力权重,选择最优尺度的特征图,动态调整后续层的有效感受野。
  • BARNet将BAM与ARF模块整合到统一的编码器-解码器架构中,支持端到端训练与推理。

实验结果

研究问题

  • RQ1如何有效建模全局上下文与语义依赖,以改善受光照变化影响区域的特征表示?
  • RQ2自适应多尺度特征融合对在大尺度变化下分割精度的影响如何?
  • RQ3双线性注意力与自适应感受野的结合相较于传统注意力与固定感受野有何优势?
  • RQ4所提出的模块是否能提升在极端光照与尺度变化挑战性数据集上的分割性能?
  • RQ5BARNet在多样化外科手术器械与内窥镜场景中的泛化能力如何?

主要发现

  • BARNet在Cata7数据集上达到97.47%的平均IOU,比第二名方法高出1.85个百分点。
  • 在EndoVis 2017基准测试中,BARNet实现64.30%的平均IOU,较第二名方法(TernausNet)提升10.10个百分点。
  • 双线性注意力模块显著提升了易受镜面反射影响的器械(如主要切开刀I1、镜头钩I6和双极钳I10)的分割精度。
  • BARNet在EndoVis 2017中获得第一名,在10个视频序列中的7个中取得最佳结果。
  • 可视化结果表明,BARNet即使在强阴影和镜面反射区域也能准确分割器械。
  • 消融实验证实,双线性注意力与自适应感受野模块各自均对性能提升有贡献,两者联合使用可获得最优效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。