Skip to main content
QUICK REVIEW

[论文解读] Masked-attention Mask Transformer for Universal Image Segmentation

Bowen Cheng, Ishan Misra|arXiv (Cornell University)|Dec 2, 2021
Advanced Neural Network Applications参考文献 57被引用 127
一句话总结

Mask2Former 是一个通用的图像分割架构,使用掩模注意力,在多数据集上优于专用模型,在全景、实例和语义任务上提升训练效率。

ABSTRACT

Image segmentation is about grouping pixels with different semantics, e.g., category or instance membership, where each choice of semantics defines a task. While only the semantics of each task differ, current research focuses on designing specialized architectures for each task. We present Masked-attention Mask Transformer (Mask2Former), a new architecture capable of addressing any image segmentation task (panoptic, instance or semantic). Its key components include masked attention, which extracts localized features by constraining cross-attention within predicted mask regions. In addition to reducing the research effort by at least three times, it outperforms the best specialized architectures by a significant margin on four popular datasets. Most notably, Mask2Former sets a new state-of-the-art for panoptic segmentation (57.8 PQ on COCO), instance segmentation (50.1 AP on COCO) and semantic segmentation (57.7 mIoU on ADE20K).

研究动机与目标

  • 提出一个能够以单一设计同时处理全景、实例和语义任务的通用分割架构。
  • 通过展示单一模型在多种分割任务上也能表现良好,消除碎片化。
  • 在不牺牲准确性的前提下,提升通用分割的训练效率与可访问性。
  • 证明掩模注意力和多尺度高分辨率特征能够提升收敛性和性能。
  • 提供消融研究以理解哪些组件在各任务上带来提升。

提出的方法

  • 引入一个元架构,包含骨干网络、像素解码器和在掩码查询上工作的 Transformer 解码器。
  • 用掩模注意力替代标准的交叉注意力,使注意力仅在预测的掩膜区域内。
  • 使用多尺度高分辨率特征策略,以更好地对小物体进行分割。
  • 应用优化策略:重新排序自注意力与交叉注意力、使查询特征可学习、并移除 dropout。
  • 通过对有限的随机抽样点计算掩膜损失,降低训练内存占用。

实验结果

研究问题

  • RQ1单一架构能否在全景、实例和语义分割上实现最先进的性能?
  • RQ2掩模注意力和高分辨率多尺度特征是否能加速训练并提高准确性?
  • RQ3哪些优化与训练策略能够实现通用分割模型的实际训练?
  • RQ4在常用数据集上,Mask2Former 与专用架构及其他通用架构相比如何?
  • RQ5该方法在不同骨干和数据集上是否具有鲁棒性?

主要发现

  • Mask2Former 在多个数据集的全景、实例和语义分割上达到最先进或同等水平。
  • 同一架构在 COCO 全景上达到 57.8 PQ、COCO 实例上 50.1 AP、ADE20K 语义分割上 57.7 mIoU,刷新了新的最先进水平。
  • 掩模注意力相比标准交叉注意力显著提升性能和收敛性。
  • 高分辨率多尺度特征显著提升对小对象的分割,且高效的多尺度策略降低 FLOPs。
  • 通过可学习查询、移除 dropout、以及基于采样的掩膜损失,在保持精度的同时提升了训练效率并降低内存。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。