Skip to main content
QUICK REVIEW

[论文解读] Towards Universal Object Detection by Domain Attention

Xudong Wang, Zhaowei Cai|arXiv (Cornell University)|Apr 9, 2019
Advanced Neural Network Applications参考文献 59被引用 19
一句话总结

本文提出一种领域感知的通用目标检测器,采用可学习的、通用的挤压-激励(SE)适配器共享主干网络,并引入一种新颖的领域注意力机制,以在无需先验领域知识的情况下,动态地将特征路由至特定领域的子网络。该方法在11个多样化数据集上实现了最先进性能,超越了在未充分探索领域中的单领域检测器,且参数量仅比单领域基线模型多1.3倍。

ABSTRACT

Despite increasing efforts on universal representations for visual recognition, few have addressed object detection. In this paper, we develop an effective and efficient universal object detection system that is capable of working on various image domains, from human faces and traffic signs to medical CT images. Unlike multi-domain models, this universal model does not require prior knowledge of the domain of interest. This is achieved by the introduction of a new family of adaptation layers, based on the principles of squeeze and excitation, and a new domain-attention mechanism. In the proposed universal detector, all parameters and computations are shared across domains, and a single network processes all domains all the time. Experiments, on a newly established universal object detection benchmark of 11 diverse datasets, show that the proposed detector outperforms a bank of individual detectors, a multi-domain detector, and a baseline universal detector, with a 1.3x parameter increase over a single-domain baseline detector. The code and benchmark will be released at http://www.svcl.ucsd.edu/projects/universal-detection/.

研究动机与目标

  • 解决缺乏能够在无先验领域知识的情况下泛化于多样化图像领域的通用目标检测系统的问题。
  • 克服多领域检测器在推理时需要识别领域且随领域数量线性增长参数量的局限性。
  • 设计一种单一、参数高效且始终激活的检测器,通过数据驱动的注意力机制自适应未知领域。
  • 建立一个新的基准UODB,包含11个多样化的目标检测数据集,用于评估通用检测性能。
  • 证明在多个领域间共享表征学习可显著提升低资源和领域分布偏移数据集上的检测性能。

提出的方法

  • 提出一种通用目标检测器,采用共享主干网络,并在关键层插入通用SE适配器库,以实现特征调制。
  • 引入领域注意力(DA)模块,通过在SE适配器输出上学习注意力机制,实现将特征响应分配至特定领域。
  • 使用所有11个数据集的多任务学习目标端到端训练整个网络,使DA模块在无监督条件下学习领域特定的路由策略。
  • 采用轻量化、参数高效的适配器设计,受挤压-激励网络启发,以最小化计算开销。
  • 将DA模块应用于动态地将激活信息路由至领域专用子网络,使同一网络在推理时可适应多个领域。
  • 通过在所有数据集上联合训练方案优化模型,实现知识迁移并提升泛化能力,尤其在低资源领域表现更优。

实验结果

研究问题

  • RQ1是否可以训练一个单一的通用目标检测器,在无需推理时识别领域的情况下,对多样化且无重叠的图像领域均表现良好?
  • RQ2数据驱动的领域注意力机制在使共享检测器适应具有显著领域差异的多个领域方面有多高效?
  • RQ3在多个数据集间共享表征学习,能在多大程度上提升低资源或领域分布偏移数据集上的检测性能?
  • RQ4所提出的通用检测器是否优于专门的单领域检测器以及需要领域特定微调的多领域检测器?
  • RQ5是否仅通过在神经网络中战略性地放置少量通用适配器,即可实现与完整适配器库相当的性能,同时减少参数量?

主要发现

  • 所提出的领域感知通用检测器在UODB基准上优于独立检测器集合、多领域检测器和基线通用检测器。
  • 在COCO和VOC数据集上,当在全部11个数据集上联合训练时,通用检测器相比单领域基线模型mAP提升4.5个百分点,参数量仅增加1.3倍。
  • 在KITTI数据集上,通用检测器在Moderate设置下mAP提升6.4个百分点,性能与为该数据集专门优化的检测器相当。
  • 在低资源领域(如DeepLesion)和跨领域数据集(如clipart、comic)上,通用检测器显著优于当前最先进方法,通过联合训练有效缓解了过拟合。
  • 仅使用6个通用SE适配器(位于第一层和中间层)的蒸馏版本模型在参数更少的情况下实现了最佳性能,mAP相比单领域基线提升4.5个百分点。
  • 领域注意力机制成功学习到领域特定的路由策略,如VOC/COCO(相似)与DOTA/DeepLesion(不同)数据集间表现出截然不同的注意力分布,验证了其捕捉领域特征的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。