Skip to main content
QUICK REVIEW

[论文解读] MaX-DeepLab: End-to-End Panoptic Segmentation with Mask Transformers

Huiyu Wang, Yukun Zhu|arXiv (Cornell University)|Dec 1, 2020
Advanced Neural Network Applications参考文献 98被引用 32
一句话总结

MaX-DeepLab 是首个端到端的全景分割模型,直接用掩码变换器和双路径 CNN+内存架构预测带类别标签的掩码,在 COCO 上无需测试时增强即可达到最先进的 PQ。

ABSTRACT

We present MaX-DeepLab, the first end-to-end model for panoptic segmentation. Our approach simplifies the current pipeline that depends heavily on surrogate sub-tasks and hand-designed components, such as box detection, non-maximum suppression, thing-stuff merging, etc. Although these sub-tasks are tackled by area experts, they fail to comprehensively solve the target task. By contrast, our MaX-DeepLab directly predicts class-labeled masks with a mask transformer, and is trained with a panoptic quality inspired loss via bipartite matching. Our mask transformer employs a dual-path architecture that introduces a global memory path in addition to a CNN path, allowing direct communication with any CNN layers. As a result, MaX-DeepLab shows a significant 7.1% PQ gain in the box-free regime on the challenging COCO dataset, closing the gap between box-based and box-free methods for the first time. A small variant of MaX-DeepLab improves 3.0% PQ over DETR with similar parameters and M-Adds. Furthermore, MaX-DeepLab, without test time augmentation, achieves new state-of-the-art 51.3% PQ on COCO test-dev set. Code is available at https://github.com/google-research/deeplab2.

研究动机与目标

  • 推动一种端到端的全景分割方法,避免像锚框、框和 NMS 这样的手工先验。
  • 直接预测一组带类别标签的掩码,并用受 PQ 启发的二部匹配损失进行优化。
  • 引入一种双路径变换器,使全局内存与 CNN 层之间能够进行通信。
  • 展示端到端掩码预测在 COCO 上缩小了基于框的方法与无框方法之间的差距。

提出的方法

  • 直接为每张图像预测一组固定大小的带类别标签的掩码及其概率。
  • 使用基于一对一二部匹配的 PQ 风格损失进行训练,匹配预测掩码与真实掩码。
  • 引入一个双路径变换器,将 CNN 像素路径与一维全局内存路径耦合起来,支持四种注意力模式(M2P、M2M、P2M、P2P)。
  • 使用堆叠式 hourglass 风格的解码器来融合多尺度特征并形成掩码预测。
  • 辅助损失包括逐像素的实例判别、掩码-ID 交叉熵以及语义分割损失以辅助训练。

实验结果

研究问题

  • RQ1一个端到端模型是否能够直接预测全景掩码,而不需要如框或中心点等代理子任务?
  • RQ2通过二部匹配优化 PQ 风格目标是否能提升全景分割性能,与基于框的方法或无框方法相比?
  • RQ3双路径变换器是否能有效地将 CNN 特征与全局内存整合,以提升掩码预测质量?
  • RQ4解码器深度、输入分辨率和注意力类型对 COCO 上的 PQ 及相关指标有何影响?
  • RQ5辅助损失(实例判别、掩码-ID 交叉熵、语义分割)是否带来可衡量的提升?

主要发现

  • MaX-DeepLab 在 COCO test-dev 上无需测试时增强实现最先进的 PQ(大型模型为 51.3% 的 PQ)。
  • 在无框 regime 下,MaX-DeepLab 比 Axial-DeepLab 高出 7.1% 的 PQ,并在强条件下优于基于框的 DetectoRS,缩小了基于框与无框方法之间的差距。
  • 轻量级变体(MaX-DeepLab-S)在验证集上比参数量相近的 DETR 高出 3.3% 的 PQ,在 test-dev 上高出 3.0% 的 PQ。
  • 双路径变换器在多分辨率上实现 CNN 特征与全局内存的形成与通信,从而提升掩码预测。
  • 辅助损失,尤其是逐像素实例判别和掩码-ID 预测,与 PQ 风格损失结合时带来显著的 PQ 增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。