Skip to main content
QUICK REVIEW

[论文解读] DCT-Mask: Discrete Cosine Transform Mask Representation for Instance Segmentation

Xing Shen, Jirui Yang|arXiv (Cornell University)|Nov 19, 2020
Advanced Neural Network Applications参考文献 34被引用 9
一句话总结

DCT-Mask 提出了一种基于离散余弦变换(DCT)的新颖掩码表示方法,可将高分辨率二值掩码压缩为紧凑且低复杂度的向量,显著提升实例分割性能。通过利用 DCT 的能量集中特性,保留关键的低频掩码特征,该方法在不增加推理成本的前提下,使 COCO 和 LVIS 数据集上的掩码 AP 提升最高达 2.1%,并可无缝集成至现有的基于像素的框架(如 Mask R-CNN 和 Cascade R-CNN)。

ABSTRACT

Binary grid mask representation is broadly used in instance segmentation. A representative instantiation is Mask R-CNN which predicts masks on a $28 imes 28$ binary grid. Generally, a low-resolution grid is not sufficient to capture the details, while a high-resolution grid dramatically increases the training complexity. In this paper, we propose a new mask representation by applying the discrete cosine transform(DCT) to encode the high-resolution binary grid mask into a compact vector. Our method, termed DCT-Mask, could be easily integrated into most pixel-based instance segmentation methods. Without any bells and whistles, DCT-Mask yields significant gains on different frameworks, backbones, datasets, and training schedules. It does not require any pre-processing or pre-training, and almost no harm to the running speed. Especially, for higher-quality annotations and more complex backbones, our method has a greater improvement. Moreover, we analyze the performance of our method from the perspective of the quality of mask representation. The main reason why DCT-Mask works well is that it obtains a high-quality mask representation with low complexity. Code is available at https://github.com/aliyun/DCT-Mask.git.

研究动机与目标

  • 解决实例分割中低分辨率二值网格掩码表示的局限性,后者无法捕捉细微细节并导致重建误差。
  • 开发一种高质量、低复杂度的掩码表示方法,在降低训练与推理开销的同时保持高保真度。
  • 在无需预训练或架构大规模重构的前提下,实现与现有基于像素的实例分割框架的无缝集成。
  • 在多种数据集、主干网络和标注质量下展示一致的性能提升。
  • 证明提升掩码表示质量可直接增强掩码 AP,即使计算成本极低。

提出的方法

  • 该方法通过离散余弦变换(DCT)将高分辨率二值掩码(如 128×128)转换至频域,仅保留最重要的低频系数。
  • 由此生成的 DCT 系数向量(如 300 维)作为紧凑且高保真的掩码表示,可保留关键的结构细节。
  • 该 DCT 基于的表示方法通过极少的架构修改,集成至现有的实例分割模型(如 Mask R-CNN 和 Cascade R-CNN)。
  • 该方法避免了预训练或预处理,依赖 DCT 的固有数学特性实现高效、实时的压缩与重建。
  • 在推理阶段,通过逆 DCT 将 DCT 系数解码回高分辨率掩码,实现精确的掩码重建。
  • 该方法兼容任意掩码头架构,如不同全连接层配置下均表现出一致的性能增益。

实验结果

研究问题

  • RQ1基于 DCT 的掩码表示是否能在保持低计算复杂度的同时,实现比低分辨率二值网格更高的重建保真度?
  • RQ2提升掩码表示质量是否能在多种数据集和主干网络架构下带来可测量的 AP 提升?
  • RQ3DCT-Mask 是否可在无需预训练或显著架构修改的前提下,有效集成至现有实例分割框架?
  • RQ4与 PCA 或迭代渲染方法(如 PointRend)等其他紧凑表示方法相比,DCT-Mask 在准确率、FLOPs 和推理速度方面表现如何?
  • RQ5DCT-Mask 的性能增益是否随标注质量与模型复杂度的提升而扩大?

主要发现

  • DCT-Mask 使用从 128×128 掩码压缩得到的 300 维 DCT 向量,实现了 97% 的 IoU,显著优于标准 28×28 二值网格的 93.8% IoU。
  • 在 COCO 数据集上,DCT-Mask 使用 ResNet-50 时将掩码 AP 提升 1.3%,使用 ResNeXt-101 时提升 2.0%,在不同主干网络上均表现一致的增益。
  • 在 LVIS 数据集上,DCT-Mask 使用 ResNet-50 时实现 2.1% 的 AP 提升,使用 ResNeXt-101 时提升达 3.1%,表明在复杂或高质量标注数据上收益更显著。
  • 在 Cityscapes 数据集上,DCT-Mask 将 AP 从基线的 30.6 提升至 30.6(改进后),表明在精细标注数据集上也保持了稳定的性能增益。
  • DCT-Mask 在 AP(36.5 vs. 36.3)和推理速度(22 FPS vs. 16 FPS)方面均优于 PointRend,同时仅消耗其一半的 FLOPs。
  • 该方法几乎不带来速度损失,在 V100 GPU 上保持 22 FPS 的推理速度,且无需预训练或预处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。