Skip to main content
QUICK REVIEW

[论文解读] Autofocus Layer for Semantic Segmentation

Yao Qin, Konstantinos Kamnitsas|arXiv (Cornell University)|May 22, 2018
Medical Image Segmentation Techniques参考文献 13被引用 17
一句话总结

本文提出了一种自聚焦卷积层,这是一种新颖的模块,通过使用可学习的注意力机制,结合并行空洞卷积,自适应地调整CNN在语义分割任务中的有效感受野。该方法在参数增加极少的情况下,提升了多尺度特征学习能力,在骨盆CT和脑部MRI分割任务中实现了最先进性能,能够动态聚焦于每个空间位置的最相关上下文。

ABSTRACT

We propose the autofocus convolutional layer for semantic segmentation with the objective of enhancing the capabilities of neural networks for multi-scale processing. Autofocus layers adaptively change the size of the effective receptive field based on the processed context to generate more powerful features. This is achieved by parallelising multiple convolutional layers with different dilation rates, combined by an attention mechanism that learns to focus on the optimal scales driven by context. By sharing the weights of the parallel convolutions we make the network scale-invariant, with only a modest increase in the number of parameters. The proposed autofocus layer can be easily integrated into existing networks to improve a model's representational power. We evaluate our models on the challenging tasks of multi-organ segmentation in pelvic CT and brain tumor segmentation in MRI and achieve very promising performance.

研究动机与目标

  • 解决医学图像语义分割中有效多尺度上下文学习的挑战。
  • 在不显著增加模型复杂度的前提下,提升深度网络中的特征表示能力。
  • 通过注意力图显式展示尺度选择过程,提升模型可解释性。
  • 通过极少的架构改动,实现与现有网络的轻松集成。
  • 在具有挑战性的医学图像分割基准上,以轻量化、可扩展的模块实现具有竞争力的性能。

提出的方法

  • 自聚焦层使用不同空洞率的并行空洞卷积,以捕捉多尺度上下文信息。
  • 注意力机制为每个尺度计算动态权重,使网络能够聚焦于每个空间位置的最相关上下文。
  • 空洞卷积之间共享权重,确保尺度不变性并减少参数量。
  • 输出为所有尺度特征的加权和,其中权重基于输入上下文学习得到。
  • 该模块设计为即插即用层,可直接替换现有网络中的标准卷积层。
  • 该方法受人类视觉注意力启发,模拟了中央凹(聚焦)和周边(广域)视觉。

实验结果

研究问题

  • RQ1可学习的自适应机制是否能改善语义分割网络中的多尺度特征学习?
  • RQ2通过注意力实现的动态尺度选择是否优于固定或平均化的多尺度融合?
  • RQ3所提出的模块是否能以极少的架构改动和参数开销,轻松集成到现有网络中?
  • RQ4自聚焦层在具有高度生物学变异性的多样化医学影像任务中表现如何?
  • RQ5注意力机制在分割任务中在多大程度上提升了模型的可解释性?

主要发现

  • 在骨盆CT和脑肿瘤分割任务中,自聚焦层均优于标准ASPP模块,多数结构的Dice分数更高。
  • Afn-6在BRATS’15测试集上实现了84%的整个肿瘤Dice分数,优于半自动方法,并与顶尖的集成模型相当。
  • Afn-6模型在核心区域实现了69%的Dice分数,超过基线模型和大多数消融变体,证明了多层自适应的优势。
  • 该方法仅带来适度的参数增加——Afn-1模型的可训练参数为349,904个,相比基线模型的315,725个,增幅较小。
  • 消融研究显示,将更多层转换为自聚焦层可持续提升性能,Afn-6在两个数据集上均取得最佳结果。
  • 注意力图显示,网络能根据上下文自适应地‘放大’或‘缩小’感受野,从而增强模型可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。