[论文解读] End-to-End Object Detection with Fully Convolutional Network
该论文提出了一种端到端目标检测框架,通过引入预测感知的一对一(POTO)标签分配和三维最大池化(3DMF),在全卷积神经网络中消除了非极大值抑制(NMS)的需求。该方法在COCO和CrowdHuman数据集上均达到最先进性能,mAP相比基于NMS的检测器提升1.1%,mMR提升6.0%,在人群密集场景中表现出更强的鲁棒性。
Mainstream object detectors based on the fully convolutional network has achieved impressive performance. While most of them still need a hand-designed non-maximum suppression (NMS) post-processing, which impedes fully end-to-end training. In this paper, we give the analysis of discarding NMS, where the results reveal that a proper label assignment plays a crucial role. To this end, for fully convolutional detectors, we introduce a Prediction-aware One-To-One (POTO) label assignment for classification to enable end-to-end detection, which obtains comparable performance with NMS. Besides, a simple 3D Max Filtering (3DMF) is proposed to utilize the multi-scale features and improve the discriminability of convolutions in the local region. With these techniques, our end-to-end framework achieves competitive performance against many state-of-the-art detectors with NMS on COCO and CrowdHuman datasets. The code is available at https://github.com/Megvii-BaseDetection/DeFCN .
研究动机与目标
- 从全卷积目标检测器的端到端训练中消除非极大值抑制(NMS)后处理步骤。
- 解决无锚点检测器中因一对多标签分配导致的重复预测问题。
- 提升在人群密集和复杂场景下的特征判别能力与定位精度。
- 通过可学习的、具有空间感知能力的模块替代启发式后处理,实现完全可微分的训练。
- 证明采用POTO与3DMF的端到端训练在性能上可与基于NMS的最先进检测器相媲美或超越。
提出的方法
- 提出预测感知的一对一(POTO)标签分配策略,基于分类与回归质量的联合评估,动态地为每个真实框分配一个正样本。
- 引入三维最大池化(3DMF),一种可微分的多尺度空间滤波模块,应用于相邻特征金字塔层级之间,以抑制重复预测。
- 采用基于一对多标签分配的辅助损失,为特征学习提供充分监督,同时保持端到端训练的完整性。
- 将POTO与3DMF集成到FCOS框架中,使用ResNeXt-101与ResNet-50主干网络,在COCO与CrowdHuman数据集上进行评估。
- 在空间与尺度维度上使用三维最大池化操作(卷积核大小φ=3,τ=2),以增强局部区域的判别能力。
- 通过用可学习、可微分的组件替代NMS,消除人工设计的后处理步骤,实现完整的端到端优化。

实验结果
研究问题
- RQ1全卷积目标检测器是否能在无需非极大值抑制(NMS)后处理的情况下实现具有竞争力的性能?
- RQ2何种标签分配策略可有效支持无锚点检测器的端到端训练?
- RQ3如何利用多尺度特征表示来减少目标检测中的重复预测?
- RQ4可微分的、具有空间感知能力的滤波机制是否能提升密集场景下的检测性能与鲁棒性?
- RQ5在COCO与CrowdHuman等挑战性基准上,采用POTO与3DMF的端到端训练是否能超越基于NMS的最先进检测器?
主要发现
- 所提出的端到端检测器在使用ResNeXt-101主干网络时,mAP相比COCO数据集上使用NMS的FCOS提升1.1%。
- 在CrowdHuman数据集中,该方法相比使用NMS的FCOS,AP50提升3.0%,mMR提升6.0%,表明在人群密集场景中性能更优。
- 端到端模型的召回率超过使用NMS的真实框,表明检测完整性得到提升。
- 随着训练进行,端到端模型与基于NMS模型的性能差距逐渐缩小,且在COCO数据集上训练180k轮后,端到端模型超越基线。
- 当卷积核大小φ=3且τ=2时,3DMF取得最优性能,证实重复预测源于相邻尺度间的局部区域。
- 该方法计算开销较低,相比基线NMS检测器仅带来轻微的推理成本增加。
![Figure 2: The diagram of the head with 3D Max Filtering (3DMF) in a FPN stage. ‘POTO’ indicates the proposed Prediction-aware One-to-one Label Assignment rule to achieve end-to-end detection. ‘Conv + $\sigma$ ’ denotes a convolution layer followed by a sigmoid function [ 10 ] , which outputs coarsel](https://ar5iv.labs.arxiv.org/html/2012.03544/assets/Figure/head.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。