[论文解读] Masked-attention Mask Transformer for Universal Image Segmentation
Mask2Former 是一个通用的图像分割架构,使用掩模注意力,在多数据集上优于专用模型,在全景、实例和语义任务上提升训练效率。
Image segmentation is about grouping pixels with different semantics, e.g., category or instance membership, where each choice of semantics defines a task. While only the semantics of each task differ, current research focuses on designing specialized architectures for each task. We present Masked-attention Mask Transformer (Mask2Former), a new architecture capable of addressing any image segmentation task (panoptic, instance or semantic). Its key components include masked attention, which extracts localized features by constraining cross-attention within predicted mask regions. In addition to reducing the research effort by at least three times, it outperforms the best specialized architectures by a significant margin on four popular datasets. Most notably, Mask2Former sets a new state-of-the-art for panoptic segmentation (57.8 PQ on COCO), instance segmentation (50.1 AP on COCO) and semantic segmentation (57.7 mIoU on ADE20K).
研究动机与目标
- 提出一个能够以单一设计同时处理全景、实例和语义任务的通用分割架构。
- 通过展示单一模型在多种分割任务上也能表现良好,消除碎片化。
- 在不牺牲准确性的前提下,提升通用分割的训练效率与可访问性。
- 证明掩模注意力和多尺度高分辨率特征能够提升收敛性和性能。
- 提供消融研究以理解哪些组件在各任务上带来提升。
提出的方法
- 引入一个元架构,包含骨干网络、像素解码器和在掩码查询上工作的 Transformer 解码器。
- 用掩模注意力替代标准的交叉注意力,使注意力仅在预测的掩膜区域内。
- 使用多尺度高分辨率特征策略,以更好地对小物体进行分割。
- 应用优化策略:重新排序自注意力与交叉注意力、使查询特征可学习、并移除 dropout。
- 通过对有限的随机抽样点计算掩膜损失,降低训练内存占用。
实验结果
研究问题
- RQ1单一架构能否在全景、实例和语义分割上实现最先进的性能?
- RQ2掩模注意力和高分辨率多尺度特征是否能加速训练并提高准确性?
- RQ3哪些优化与训练策略能够实现通用分割模型的实际训练?
- RQ4在常用数据集上,Mask2Former 与专用架构及其他通用架构相比如何?
- RQ5该方法在不同骨干和数据集上是否具有鲁棒性?
主要发现
- Mask2Former 在多个数据集的全景、实例和语义分割上达到最先进或同等水平。
- 同一架构在 COCO 全景上达到 57.8 PQ、COCO 实例上 50.1 AP、ADE20K 语义分割上 57.7 mIoU,刷新了新的最先进水平。
- 掩模注意力相比标准交叉注意力显著提升性能和收敛性。
- 高分辨率多尺度特征显著提升对小对象的分割,且高效的多尺度策略降低 FLOPs。
- 通过可学习查询、移除 dropout、以及基于采样的掩膜损失,在保持精度的同时提升了训练效率并降低内存。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。