Skip to main content
QUICK REVIEW

[论文解读] TOOD: Task-aligned One-stage Object Detection

Chengjian Feng, Yujie Zhong|arXiv (Cornell University)|Aug 17, 2021
Advanced Neural Network Applications参考文献 35被引用 15
一句话总结

TODO 提出了一种任务对齐的一阶段目标检测器,通过任务对齐头(T-Head)和任务对齐学习(TAL)显式对齐分类与定位任务,在 MS-COCO 上实现了 51.1 AP 的性能,显著超越了 ATSS、GFL 和 PAA 等先前的一阶段检测器,且参数量和 FLOPs 更少。

ABSTRACT

One-stage object detection is commonly implemented by optimizing two sub-tasks: object classification and localization, using heads with two parallel branches, which might lead to a certain level of spatial misalignment in predictions between the two tasks. In this work, we propose a Task-aligned One-stage Object Detection (TOOD) that explicitly aligns the two tasks in a learning-based manner. First, we design a novel Task-aligned Head (T-Head) which offers a better balance between learning task-interactive and task-specific features, as well as a greater flexibility to learn the alignment via a task-aligned predictor. Second, we propose Task Alignment Learning (TAL) to explicitly pull closer (or even unify) the optimal anchors for the two tasks during training via a designed sample assignment scheme and a task-aligned loss. Extensive experiments are conducted on MS-COCO, where TOOD achieves a 51.1 AP at single-model single-scale testing. This surpasses the recent one-stage detectors by a large margin, such as ATSS (47.7 AP), GFL (48.2 AP), and PAA (49.0 AP), with fewer parameters and FLOPs. Qualitative results also demonstrate the effectiveness of TOOD for better aligning the tasks of object classification and localization. Code is available at https://github.com/fcjian/TOOD.

研究动机与目标

  • 解决一阶段检测器中因分类与定位分支并行、独立导致的空间误对齐问题。
  • 克服任务无关样本分配方法常为分类与定位任务选择不一致最优锚框的局限性。
  • 通过新型基于学习的机制增强任务间交互与对齐,提升检测性能。
  • 通过减少冗余和错误的边界框,提升与非极大值抑制(NMS)的兼容性。
  • 在计算开销和参数量更少的前提下,实现最先进性能,优于先前方法。

提出的方法

  • 设计一种任务对齐头(T-Head),用于计算任务交互特征,并使用任务对齐预测器(TAP)增强分类与定位任务间的协作。
  • 提出任务对齐学习(TAL),采用基于锚框对齐度量的新样本分配方案,选择有助于对齐的训练样本。
  • 设计一种任务对齐损失函数,在训练过程中逐步统一分类与定位任务的最优锚框。
  • 在头部塔的前两层中应用可变形卷积(DCN),以提升空间特征适应性,增强对齐效果。
  • 采用多任务学习框架,使分类与定位任务在共享交互特征的基础上联合优化。
  • 在样本分配中结合 IoU 基准与几何基准度量,确保分类与定位任务间正样本选择的一致性。

实验结果

研究问题

  • RQ1显式对齐分类与定位任务是否能提升一阶段目标检测的性能?
  • RQ2共享且交互式的头部结构是否能减少分类与定位预测之间的空间误对齐?
  • RQ3任务对齐损失与样本分配方案是否能在训练过程中统一两类任务的最优锚框?
  • RQ4任务对齐如何影响 NMS 性能,以及对正确、冗余和错误边界框之间的平衡有何影响?
  • RQ5TODO 在准确率、参数效率和 FLOPs 方面,相较于现有一阶段检测器,其性能提升程度如何?

主要发现

  • 在单模型、单尺度测试下,TODO 在 MS-COCO 上实现 51.1 AP,显著优于 ATSS(47.7 AP)、GFL(48.2 AP)和 PAA(49.0 AP)。
  • 使用 ResNeXt-101-64×4d-DCN 时,TODO 实现 51.1 AP,较 ATSS(48.3 → 51.1 AP)提升 2.8 AP,较 GFL(49.0 → 51.1 AP)提升 2.0 AP。
  • 分类与定位排序之间的皮尔逊积矩相关系数(PCC)从基线的 0.408 提升至使用 T-Head 和 TAL 后的 0.452,表明对齐效果更好。
  • 前 10 名预测框的平均 IoU 从 0.637 提升至 0.661,表明定位一致性得到改善。
  • 在 NMS 后,与基线相比,TODO 减少了 4,186 个冗余框和 23,668 个错误框,同时正确框数量增加了 473 个。
  • TODO 展现出更优的 NMS 兼容性,能保留更多正确检测结果,并更有效地抑制虚假正例和重复框。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。