[论文解读] E2EC: An End-to-End Contour-based Method for High-Quality High-Speed Instance Segmentation
E2EC 提出了一种端到端的、基于轮廓的实例分割方法,用可学习的架构替代了手工设计的轮廓初始化,采用多方向对齐进行标签采样,并引入动态匹配损失以提升边界质量。该方法在 COCO 数据集上实现了 36.5 AP det 和 34.0 AP msk 的最先进性能,同时在 512×512 图像上保持了 36 fps 的实时推理速度。
Contour-based instance segmentation methods have developed rapidly recently but feature rough and hand-crafted front-end contour initialization, which restricts the model performance, and an empirical and fixed backend predicted-label vertex pairing, which contributes to the learning difficulty. In this paper, we introduce a novel contour-based method, named E2EC, for high-quality instance segmentation. Firstly, E2EC applies a novel learnable contour initialization architecture instead of hand-crafted contour initialization. This consists of a contour initialization module for constructing more explicit learning goals and a global contour deformation module for taking advantage of all of the vertices' features better. Secondly, we propose a novel label sampling scheme, named multi-direction alignment, to reduce the learning difficulty. Thirdly, to improve the quality of the boundary details, we dynamically match the most appropriate predicted-ground truth vertex pairs and propose the corresponding loss function named dynamic matching loss. The experiments showed that E2EC can achieve a state-of-the-art performance on the KITTI INStance (KINS) dataset, the Semantic Boundaries Dataset (SBD), the Cityscapes and the COCO dataset. E2EC is also efficient for use in real-time applications, with an inference speed of 36 fps for 512*512 images on an NVIDIA A6000 GPU. Code will be released at https://github.com/zhang-tao-whu/e2ec.
研究动机与目标
- 为解决现有基于轮廓的实例分割方法依赖手工设计初始轮廓和固定顶点配对所带来的局限,这些局限导致训练难度高且边界质量差。
- 通过引入多方向对齐(MDA)标签采样方案,降低学习难度,实现更灵活、更优的预测-真实顶点匹配。
- 通过动态匹配损失(DML)函数,在训练过程中自适应地配对预测和真实顶点,从而提升边界细节质量。
- 通过集成利用所有顶点特征而非仅局部邻近顶点的全局轮廓变形模块,实现高精度与实时推理速度的统一。
- 建立一个强大且可泛化的基于轮廓的实例分割基线,可轻松适配至其他方法。
提出的方法
- E2EC 用可学习的轮廓初始化架构替代手工设计的初始轮廓,直接从中心点特征回归完整初始轮廓,避免了基于射线或形状的固定初始化方式。
- 引入全局轮廓变形模块,利用所有顶点和中心点的特征对初始轮廓进行优化,相比仅依赖局部聚合,能更好地利用全局上下文信息。
- 多方向对齐(MDA)方案在多个方向上动态采样标签,通过避免次优顶点配对,降低训练难度并提升收敛速度。
- 提出动态匹配损失(DML)函数,在训练过程中自动识别最合适的预测-真实顶点配对,增强边界细节的学习能力。
- 模型采用端到端训练,将检测与分割整合于单一流程中,无需单独训练检测器。
- 该方法采用轻量级 DLA-34 主干网络,在不损失精度的前提下实现高速推理,支持实时推理。

实验结果
研究问题
- RQ1与手工设计的形状相比,可学习的轮廓初始化架构是否能显著降低训练难度并提升初始轮廓质量?
- RQ2多方向对齐(MDA)是否通过实现更灵活的标签采样,提升收敛速度并改善基于轮廓的实例分割性能?
- RQ3能否通过在训练过程中自适应调整顶点配对的动态匹配损失函数,提升边界细节精度与分割质量?
- RQ4端到端的、基于轮廓的方法是否能在标准基准上实现最先进性能,同时保持实时推理速度?
- RQ5在精度、速度和边界质量方面,E2EC 与现有的一阶段和两阶段实例分割模型相比表现如何?
主要发现
- 在 COCO 数据集上,E2EC 实现了 36.5 AP det、34.0 AP msk 和 33.3 AP bdy,分别优于 Deep Snake 3.7 AP det、2.7 AP msk 和 3.1 AP bdy。
- 在 SBD 数据集上,E2EC 的 AP msk 和 AP bdy 分别高出 Deep Snake 4.8 和 8.3,且 AP${}_{75}^{msk}$ 高出 9.1 分,表明其在边界细节学习方面具有显著优势。
- 在 Cityscapes 数据集上,E2EC 在测试集上实现 32.9 AP msk(比 Deep Snake 高 1.2),在验证集上采用多组件检测时达到 39.0 AP msk,优于 PANet 1.1 AP msk。
- 在 COCO 上,E2EC 在 30.1 fps 下实现 33.8 AP msk,比 Deep Snake 高出 3.5 AP msk,同时保持高速度。
- 更快的变体 E2EC* 在 54.3 fps 下实现 31.7 AP msk,接近 Deep Snake 速度的两倍,且仍以 1.4 AP msk 的优势超越其性能。
- 动态匹配损失和全局变形模块显著提升了边界质量,表现为更高的 AP bdy,且可视化结果准确分割了轮胎、后视镜等精细细节。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。