Skip to main content
QUICK REVIEW

[论文解读] OTA: Optimal Transport Assignment for Object Detection

Zheng Ge, Songtao Liu|arXiv (Cornell University)|Mar 26, 2021
Advanced Neural Network Applications参考文献 52被引用 7
一句话总结

本文提出最优传输分配(Optimal Transport Assignment, OTA),一种用于目标检测的全局标签分配方法,将正负锚框分配给真实框的问题建模为最优传输问题,以最小化分类损失与回归损失的综合值。通过将每个真实框视为标签的供应方,并使用Sinkhorn-Knopp迭代求解最优传输方案,OTA在COCO上达到40.7% mAP,在CrowdHuman上达到46.6% MR,性能优于现有方法,尤其在人群密集场景中表现突出。

ABSTRACT

Recent advances in label assignment in object detection mainly seek to independently define positive/negative training samples for each ground-truth (gt) object. In this paper, we innovatively revisit the label assignment from a global perspective and propose to formulate the assigning procedure as an Optimal Transport (OT) problem -- a well-studied topic in Optimization Theory. Concretely, we define the unit transportation cost between each demander (anchor) and supplier (gt) pair as the weighted summation of their classification and regression losses. After formulation, finding the best assignment solution is converted to solve the optimal transport plan at minimal transportation costs, which can be solved via Sinkhorn-Knopp Iteration. On COCO, a single FCOS-ResNet-50 detector equipped with Optimal Transport Assignment (OTA) can reach 40.7% mAP under 1X scheduler, outperforming all other existing assigning methods. Extensive experiments conducted on COCO and CrowdHuman further validate the effectiveness of our proposed OTA, especially its superiority in crowd scenarios. The code is available at https://github.com/Megvii-BaseDetection/OTA.

研究动机与目标

  • 为解决目标检测中局部、基于规则的标签分配方法性能不佳的问题,特别是针对被多个真实框共享的模糊锚框。
  • 通过引入全局优化框架,克服每个真实框独立进行正负样本分配的局限性。
  • 通过利用最优传输理论实现联合标签分配,提升训练效率与检测精度,特别是在人群密集场景中。
  • 提供一种基于原理、可微且全局最优的替代方案,以取代Max IoU或Min Area等启发式分配规则。

提出的方法

  • 将标签分配建模为最优传输(OT)问题,其中每个真实框和背景均为标签的供应方,每个锚框为需求方,需接收一个标签。
  • 定义锚框与真实框之间的单位运输成本为其分类损失与回归损失的加权和。
  • 定义锚框与背景之间的成本为其分类损失本身,以建模负样本分配。
  • 基于预测框与真实框之间的IoU,估计每个真实框应提供的正样本数量。
  • 使用Sinkhorn-Knopp算法求解所得OT问题,实现高效且可微的最优传输方案计算。
  • 将学习到的传输方案整合到训练过程中,实现全局标签分配,从而最小化所有锚框与真实框之间的总损失。

实验结果

研究问题

  • RQ1与基于单个目标的规则策略相比,全局优化框架是否能提升目标检测中的标签分配性能?
  • RQ2最优传输分配如何处理可能属于多个真实框的模糊锚框?
  • RQ3全局最优的标签分配策略是否能带来更好的泛化能力,尤其是在人群密集或遮挡严重的场景中?
  • RQ4基于OT的分配方法是否能在标准基准上超越现有的动态标签分配方法(如ATSS和PAA)?

主要发现

  • 在使用单个FCOS-ResNet-50检测器和1×学习率调度器的MS COCO数据集上,OTA实现了40.7% mAP,优于所有现有分配方法。
  • 在COCO测试开发集上,OTA在使用ResNeXt-64x4d-101-DCN和2.5×学习率调度器时达到51.5% mAP,创下单阶段检测器的新SOTA纪录。
  • 在人群密集的CrowdHuman数据集中,OTA达到46.6% MR,显著优于以往的单阶段检测器,接近两阶段检测器的性能。
  • OTA在CrowdHuman上将AP和召回率分别提升至88.4%和95.1%,展现出在高遮挡场景下的强大泛化能力。
  • 与PAA和ATSS相比,OTA在CrowdHuman上表现更优,其中PAA因缺乏清晰的正负样本边界而表现受限。
  • 通过OT实现的全局优化有效缓解了模糊锚框带来的有害梯度,从而实现更稳定、更准确的训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。