[论文解读] Mask R-CNN
Mask R-CNN 在 Faster R-CNN 之上增加一个并行的掩码预测分支,实现了 COCO 上单模型实例分割的最先进结果,并在检测和关键点任务上取得强劲成绩,得益于 RoIAlign 和按类别的掩码解耦。
We present a conceptually simple, flexible, and general framework for object instance segmentation. Our approach efficiently detects objects in an image while simultaneously generating a high-quality segmentation mask for each instance. The method, called Mask R-CNN, extends Faster R-CNN by adding a branch for predicting an object mask in parallel with the existing branch for bounding box recognition. Mask R-CNN is simple to train and adds only a small overhead to Faster R-CNN, running at 5 fps. Moreover, Mask R-CNN is easy to generalize to other tasks, e.g., allowing us to estimate human poses in the same framework. We show top results in all three tracks of the COCO suite of challenges, including instance segmentation, bounding-box object detection, and person keypoint detection. Without bells and whistles, Mask R-CNN outperforms all existing, single-model entries on every task, including the COCO 2016 challenge winners. We hope our simple and effective approach will serve as a solid baseline and help ease future research in instance-level recognition. Code has been made available at: https://github.com/facebookresearch/Detectron
研究动机与目标
- 开发一个统一、简单的框架,用于同时执行对象检测和实例分割。
- 改进 RoIs 的像素级对齐,以实现准确的掩码预测。
- 将掩码预测与分类解耦,以实现每个类别的掩码输出。
- 在 COCO 任务上评估 Mask R-CNN:实例分割、边界框检测和关键点检测。
- 证明在不同骨干架构下的训练/推理效率和框架的多样性。
提出的方法
- 将 Faster R-CNN 扩展为对每个 RoI 的并行掩码预测分支。
- 引入 RoIAlign,以通过双线性插值且不量化的方式去除 RoIPool 引起的 RoI 锯齿错位。
- 对每个 RoI 预测 K 个二进制掩码,每个类别一个,掩码分支使用逐像素 sigmoid 并以二元交叉熵损失作为掩码损失 (L_mask)。
- 使用基于 FCN 的掩码头以保留空间布局(m x m 掩码),而不是压缩为向量。
- 使用多任务损失 L = L_cls + L_box + L_mask 进行训练,在可能的地方共享特征。
- 实例化 Mask R-CNN,骨干如 ResNet-50/101、FPN,以及(可选)ResNeXt,在 COCO 上评估。
实验结果
研究问题
- RQ1在 Faster R-CNN 上添加并行掩码分支是否能在不牺牲检测性能的情况下获得准确的实例分割?
- RQ2在实例分割任务中,RoIAlign 相对于 RoIPool 如何改善掩码质量?
- RQ3通过使用独立的类别特定掩码(二元 sigmoid)来解耦掩码预测与类别预测,对实例分割的准确度是否有益?
- RQ4不同骨干网络(ResNet、FPN、ResNeXt)如何影响 Mask R-CNN 中的掩码、框和关键点性能?
- RQ5是否可以将 Mask R-CNN 有效扩展到其他任务,如人体姿态估计,同时保持速度?
主要发现
- 使用 ResNet-101-FPN 的 Mask R-CNN 在 COCO test-dev 上达到 35.7 的 mask AP,超过了以往的单模型方法。
- RoIAlign 将掩码 AP 提高约 3 点(AP 75 提高约 5 点),在更高 IoU 下有显著增益。
- 通过使用独立的类别特定掩码(二元 sigmoid)来解耦掩码与类别预测,相对于多项 Softmax 方法得到 +5.5 AP。
- 骨干选择显著影响性能;更深的网络 + FPN 和 ResNeXt 能带来显著提升(例如 ResNeXt-101-FPN 将掩码 AP 提升至 37.1)。
- 在同一骨干下,Mask R-CNN 也提升了边界框检测,且框和掩码 AP 差距缩小(例如某些配置为 2.7 点)。
- 使用特征共享推理(RPN 和 Mask R-CNN)大约每张图像在 Tesla M40 上运行 195 ms,COCO 上的训练需要 32–44 小时,8 张 GPU;多任务训练在各任务上带来显著提升。
- 该框架通过将关键点视为独热掩码,推广到人体姿态估计,在 COCO 关键点任务上达到有竞争力的 AP。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。