Skip to main content
QUICK REVIEW

[论文解读] DETR++: Taming Your Multi-Scale Detection Transformer

Chi Zhang, Lijuan Liu|arXiv (Cornell University)|Jun 7, 2022
Advanced Image and Video Retrieval Techniques被引用 7
一句话总结

DETR++ 提出了一种多尺度检测框架,通过集成双向特征金字塔网络(BiFPN)来增强原始 DETR 模型的跨尺度特征聚合能力,从而在 MS COCO 2017 上实现 1.9% 的 AP 提升,在 RICO 图标检测任务上提升 11.5%,在布局提取任务上提升 9.1%,同时在保持效率的前提下克服了自注意力机制的二次方复杂度问题。

ABSTRACT

Convolutional Neural Networks (CNN) have dominated the field of detection ever since the success of AlexNet in ImageNet classification [12]. With the sweeping reform of Transformers [27] in natural language processing, Carion et al. [2] introduce the Transformer-based detection method, i.e., DETR. However, due to the quadratic complexity in the self-attention mechanism in the Transformer, DETR is never able to incorporate multi-scale features as performed in existing CNN-based detectors, leading to inferior results in small object detection. To mitigate this issue and further improve performance of DETR, in this work, we investigate different methods to incorporate multi-scale features and find that a Bi-directional Feature Pyramid (BiFPN) works best with DETR in further raising the detection precision. With this discovery, we propose DETR++, a new architecture that improves detection results by 1.9% AP on MS COCO 2017, 11.5% AP on RICO icon detection, and 9.1% AP on RICO layout extraction over existing baselines.

研究动机与目标

  • 为解决 DETR 在小目标检测中因多尺度特征融合有限而导致的性能不佳问题。
  • 研究高效的多尺度特征聚合策略,避免自注意力机制的二次方复杂度以及匈牙利匹配的三次方复杂度。
  • 在不显著增加模型复杂度的前提下,提升 DETR 在 RICO 图标检测和布局提取等未充分探索的基准上的性能。
  • 识别 Transformer 基检测器中多尺度特征融合的最优架构,尤其针对设备端屏幕理解任务。

提出的方法

  • 集成双向特征金字塔网络(BiFPN),融合来自多个主干网络阶段的特征,实现有效的多尺度表征学习。
  • 保留原始 DETR 的编码器-解码器架构,但通过 BiFPN 中可学习的加权特征融合机制增强特征层次结构。
  • 在 Transformer 编码器之前于主干网络层级进行特征金字塔融合,使编码器能够处理更丰富、多尺度的特征。
  • 采用标准数据增强策略(随机水平翻转和裁剪),并将输入调整为 1280×1280 尺寸并填充,与 DETR 保持一致。
  • 采用可学习的对象查询机制,结合位置嵌入和匈牙利匹配,实现端到端的边界框与类别预测。
  • 根据数据集统计信息调整关键超参数,如背景类别权重和对象查询数量,以提升收敛性和性能。

实验结果

研究问题

  • RQ1在不加剧计算复杂度的前提下,将多尺度特征有效整合到 DETR 架构中的最佳方式是什么?
  • RQ2与堆叠特征、移位窗口或专用头部等其他多尺度融合策略相比,BiFPN 在提升 DETR 检测精度方面表现如何?
  • RQ3经过修改的 DETR 架构若结合 BiFPN,是否能在小目标检测基准上超越 CenterNet 和 IconNet 等当前最先进模型?
  • RQ4通过 BiFPN 实现的多尺度特征融合是否能显著提升非标准检测任务(如图标检测和布局提取)的性能?
  • RQ5与基线 DETR 相比,BiFPN 增强的 DETR++ 在训练效率和收敛速度方面保持了多大程度的优越性?

主要发现

  • DETR++ 在 MS COCO 2017 上相比原始 DETR 实现了 1.9% 的 AP 绝对提升,表明其在标准基准上的强大泛化能力。
  • 在 RICO 图标检测数据集上,DETR++ 相比现有基线模型实现了 11.5% 的检测 AP 提升,优于 DETR 和 IconNet 模型。
  • 在布局提取任务中,DETR++ 相比基线模型实现了 9.1% 的 AP 提升,展现出在功能型 UI 元素检测任务中的优异性能。
  • 尽管性能有所提升,DETR++ 在特定数据集的小目标检测任务中仍落后于 CenterNet 和 IconNet,表明仍有进一步优化空间。
  • 基于 BiFPN 的特征融合策略在所有评估方法中最为有效,显著优于移位窗口和专用头部等替代方案。
  • 该模型在性能与复杂度之间保持了良好权衡,尽管集成了多尺度特征,计算量仅出现微小增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。