Skip to main content
QUICK REVIEW

[论文解读] Sequential Context Encoding for Duplicate Removal

Lu Qi, Shu Liu|arXiv (Cornell University)|Oct 20, 2018
Advanced Neural Network Applications参考文献 34被引用 14
一句话总结

本文提出了一种基于两阶段RNN的框架,结合全局注意力机制与上下文门控,用于目标检测中的重复框去除,通过编码候选框的序列上下文信息以提升选择准确率。该方法在COCO数据集上,针对多种检测主干网络,相较于NMS实现了最高达1.5个百分点的mAP提升。

ABSTRACT

Duplicate removal is a critical step to accomplish a reasonable amount of predictions in prevalent proposal-based object detection frameworks. Albeit simple and effective, most previous algorithms utilize a greedy process without making sufficient use of properties of input data. In this work, we design a new two-stage framework to effectively select the appropriate proposal candidate for each object. The first stage suppresses most of easy negative object proposals, while the second stage selects true positives in the reduced proposal set. These two stages share the same network structure, \ie, an encoder and a decoder formed as recurrent neural networks (RNN) with global attention and context gate. The encoder scans proposal candidates in a sequential manner to capture the global context information, which is then fed to the decoder to extract optimal proposals. In our extensive experiments, the proposed method outperforms other alternatives by a large margin.

研究动机与目标

  • 为解决传统重复框去除方法(如NMS)忽略全局上下文、仅依赖得分与IoU的局限性。
  • 通过联合利用特征表示(fG)与得分特征(fS),实现对目标候选框更全面的理解,从而提升候选框选择性能。
  • 设计一种两阶段框架:第一阶段抑制简单负样本,第二阶段利用共享RNN架构结合注意力与上下文门控,实现精细化选择。
  • 证明通过RNN对候选框进行序列建模,相比贪婪或独立选择方法,能实现更好的泛化性与鲁棒性。
  • 展示该方法与现有检测流水线兼容,无需端到端联合训练即可集成,且在多种模型上均能获得一致的性能增益。

提出的方法

  • 该方法采用两阶段RNN框架:第一阶段抑制简单负样本候选框,第二阶段在精简后的集合上完成最终选择。
  • 两阶段均采用基于循环神经网络(RNN)的编码器-解码器结构,结合全局注意力与上下文门控,以建模候选框之间的长距离依赖关系。
  • 编码器按顺序处理候选框,以捕捉全局上下文信息;解码器则基于上下文化的表示生成最终选择结果。
  • 输入特征包括区域建议特征(fG)与得分特征(fS),二者拼接后输入RNN,以实现对候选框质量与空间关系的联合推理。
  • 在第二阶段采用多阈值IoU标注(如0.5–0.1–0.9)进行训练,以提升对不同重叠标准的鲁棒性。
  • 该框架与现有检测网络兼容,可作为后处理模块应用,适用于FPN、Mask R-CNN与PANet+DCN等模型,实现即插即用。

实验结果

研究问题

  • RQ1能否通过RNN对目标候选框进行序列建模,使重复框去除性能超越NMS等贪婪方法?
  • RQ2通过注意力与上下文门控从所有候选框中引入全局上下文信息,相比仅依赖得分或IoU的方法,能否显著提升选择准确率?
  • RQ3两阶段设计(第一阶段过滤简单负样本,第二阶段精细化选择)是否优于端到端的选择方法?
  • RQ4与仅依赖得分相比,候选框特征(fG)与得分特征(fS)的联合使用,对提升检测mAP的贡献有多大?
  • RQ5所提方法能否在不同目标检测主干网络上实现泛化,并在无需联合训练的情况下获得一致的性能增益?

主要发现

  • 在COCO验证集上,该方法使用FPN时,mAP相比NMS最高提升1.5个百分点;使用更强的PANet+DCN时,mAP提升1.1个百分点。
  • 在COCO测试开发集上,该方法将mAP从NMS的36.9提升至FPN的38.4,从39.1提升至Mask R-CNN的40.6。
  • 模型将每张图像的平均候选框数量从NMS的145.76降低至84.02,同时提升mAP,表明其在效率与准确率上均更优。
  • 在第二阶段采用多阈值IoU标注(0.5–0.1–0.9)相比单阈值训练,mAP提升0.3个百分点,表明多样化监督具有显著优势。
  • 消融实验表明第一阶段至关重要:若直接在检测网络输出上训练第二阶段,mAP显著下降;若以NMS输出作为输入,性能略逊于第一阶段。
  • 该方法对mAP75的提升大于mAP50,表明其尤其增强了定位质量,更倾向于选择高质量、重叠度较低的候选框。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。