Skip to main content
QUICK REVIEW

[论文解读] Learning to decompose for object detection and instance segmentation

Eunbyung Park, Alexander C. Berg|arXiv (Cornell University)|Nov 19, 2015
Advanced Neural Network Applications参考文献 25被引用 18
一句话总结

本文提出 DecompNet,一种端到端可训练的深度神经网络,结合卷积层与循环层,可在单次前向传播中生成可变长度输出,用于目标检测与实例分割,无需区域建议或非极大值抑制。通过使用新型基于掩码的损失函数,联合预测实例数量与精确定位,该方法在合成 MNIST 数字数据集上达到最先进性能,在 KITTI 汽车检测任务上也取得有前景的结果。

ABSTRACT

Although deep convolutional neural networks(CNNs) have achieved remarkable results on object detection and segmentation, pre- and post-processing steps such as region proposals and non-maximum suppression(NMS), have been required. These steps result in high computational complexity and sensitivity to hyperparameters, e.g. thresholds for NMS. In this work, we propose a novel end-to-end trainable deep neural network architecture, which consists of convolutional and recurrent layers, that generates the correct number of object instances and their bounding boxes (or segmentation masks) given an image, using only a single network evaluation without any pre- or post-processing steps. We have tested on detecting digits in multi-digit images synthesized using MNIST, automatically segmenting digits in these images, and detecting cars in the KITTI benchmark dataset. The proposed approach outperforms a strong CNN baseline on the synthesized digits datasets and shows promising results on KITTI car detection.

研究动机与目标

  • 解决依赖区域建议与非极大值抑制的传统目标检测流水线所面临的高计算成本与超参数敏感性问题。
  • 开发一种统一的、端到端可训练的架构,能够预测可变数量的目标实例,输出包含边界框或分割掩码。
  • 实现在无需预处理或后处理步骤的情况下,联合预测目标数量与精确的空间定位。
  • 通过一种新型基于掩码的损失函数,提升多类别、多目标检测与实例分割的训练稳定性和性能。

提出的方法

  • 使用卷积神经网络(CNN)为每个目标类别生成类别特定的响应图。
  • 将每个响应图输入循环网络,通过迭代方式逐个生成个体实例图,每个实例对应一个图。
  • 设计循环网络以关注整个响应图而非局部空间网格,从而实现全局上下文感知。
  • 引入一种新型基于掩码的损失函数,联合优化实例总数与每个实例的精确空间定位。
  • 使用反向传播端到端训练整个网络,使循环模块隐式学习如何分解重叠或密集的目标响应。
  • 通过为每个检测到的实例回归高分辨率掩码图,将相同架构同时应用于检测与实例分割任务。

实验结果

研究问题

  • RQ1深度学习模型是否能够在不依赖区域建议或非极大值抑制的情况下,生成可变数量的目标实例?
  • RQ2循环网络是否能够以端到端可训练的方式,有效将单类别响应图分解为多个独立的实例图?
  • RQ3一种新型基于掩码的损失函数,若能联合优化实例数量与空间定位,是否可提升检测与分割性能?
  • RQ4所提出的架构是否能在多种目标类别上泛化,并有效处理不同尺度与密度的目标?
  • RQ5该端到端方法在合成数据与真实世界基准上的性能,与强基线CNN模型及两阶段检测器相比如何?

主要发现

  • DecompNet 在合成多数字 MNIST 数据集上优于强基线CNN模型,对数字 '3'、'6' 和 '9' 的检测精度显著提升。
  • 该模型在 KITTI 汽车检测基准上取得具有竞争力的性能,表明其无需架构修改即可泛化至真实世界数据。
  • 所提出的基于掩码的损失函数实现了对实例数量与空间定位的准确联合预测,提升了训练稳定性与输出质量。
  • 循环分解机制在密集或重叠目标场景中仍能成功识别并分离出各个独立实例。
  • 该架构在合成数字数据集上达到最先进水平,其性能与两阶段检测器相比相当或更优。
  • 该方法可泛化至实例分割任务,生成高分辨率掩码图,准确定位每个目标实例,且无需后处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。