Skip to main content
QUICK REVIEW

[논문 리뷰] OTA: Optimal Transport Assignment for Object Detection

Zheng Ge, Songtao Liu|arXiv (Cornell University)|2021. 03. 26.
Advanced Neural Network Applications참고 문헌 52인용 수 7
한 줄 요약

이 논문은 객체 검출을 위한 글로벌 레이블 할당 방법인 최적 운반 할당(Optimal Transport Assignment, OTA)을 제안한다. 이는 분류 손실과 회귀 손실의 합을 최소화하기 위해 양성 및 음성 앵커를 정답 객체에 할당하는 문제를 최적 운반 문제로 공식화한다. 각 정답 객체를 레이블 공급자로 모델링하고, Sinkhorn-Knopp 반복을 사용하여 최적 운반 계획을 해결함으로써, OTA는 최신 기술 수준(SOTA)의 성능을 달성하여 COCO에서 40.7% mAP, CrowdHuman에서 46.6% MR를 기록한다. 특히 혼잡한 상황에서 기존 방법보다 뛰어난 성능을 보인다.

ABSTRACT

Recent advances in label assignment in object detection mainly seek to independently define positive/negative training samples for each ground-truth (gt) object. In this paper, we innovatively revisit the label assignment from a global perspective and propose to formulate the assigning procedure as an Optimal Transport (OT) problem -- a well-studied topic in Optimization Theory. Concretely, we define the unit transportation cost between each demander (anchor) and supplier (gt) pair as the weighted summation of their classification and regression losses. After formulation, finding the best assignment solution is converted to solve the optimal transport plan at minimal transportation costs, which can be solved via Sinkhorn-Knopp Iteration. On COCO, a single FCOS-ResNet-50 detector equipped with Optimal Transport Assignment (OTA) can reach 40.7% mAP under 1X scheduler, outperforming all other existing assigning methods. Extensive experiments conducted on COCO and CrowdHuman further validate the effectiveness of our proposed OTA, especially its superiority in crowd scenarios. The code is available at https://github.com/Megvii-BaseDetection/OTA.

연구 동기 및 목표

  • 다수의 정답 객체에 의해 공유되는 모호한 앵커가 있는 경우, 국소적이고 규칙 기반의 레이블 할당 방식의 열등한 성능을 해결하기 위해.
  • 각 정답 객체별로 독립적으로 음성/양성 할당을 수행하는 데서 비롯되는 한계를 극복하기 위해 글로벌 최적화 프레임워크를 도입하기 위해.
  • 최적 운반 이론을 활용하여 레이블 할당을 동시에 수행함으로써, 특히 혼잡한 장면에서 훈련 효율성과 검출 정확도를 향상시키기 위해.
  • Max IoU나 Min Area와 같은 히우리스틱 할당 규칙의 대안으로서 원칙적이고, 미분 가능하며, 글로벌 최적인 방법을 제공하기 위해.

제안 방법

  • 각 정답 객체와 배경이 레이블 공급자이며, 각 앵커가 하나의 레이블을 필요로 하는 최적 운반(OT) 문제로 레이블 할당을 공식화한다.
  • 앵커와 정답 객체 사이의 단위 운반 비용을 그들의 분류 손실과 회귀 손실의 가중합으로 정의한다.
  • 앵커와 배경 사이의 비용을 분류 손실 그 자체로 정의하여 음성 레이블 할당을 모델링한다.
  • 예측 박스와 정답 박스 간의 IoU를 기반으로 각 정답이 공급해야 할 양성 레이블 수를 추정한다.
  • 효율적이고 미분 가능한 최적 운반 계획 계산을 위해 결과적인 OT 문제를 Sinkhorn-Knopp 알고리즘으로 해결한다.
  • 학습 과정에 학습된 운반 계획을 통합하여, 모든 앵커와 정답 간 총 손실을 최소화하는 방식으로 글로벌하게 레이블 할당을 수행한다.

실험 결과

연구 질문

  • RQ1각 객체별로 규칙 기반 전략을 사용하는 것과 비교해, 글로벌 최적화 프레임워크가 레이블 할당 성능을 향상시킬 수 있는가?
  • RQ2최적 운반 할당 방식은 다수의 정답 객체 후보가 되는 모호한 앵커를 어떻게 처리하는가?
  • RQ3글로벌 최적 레이블 할당 전략이 특히 혼잡하거나 가림이 있는 상황에서 더 나은 일반화 성능을 보일 수 있는가?
  • RQ4OT 기반 할당 방법은 기존의 동적 레이블 할당 방법인 ATSS와 PAA보다 표준 벤치마크에서 승리할 수 있는가?

주요 결과

  • 단일 FCOS-ResNet-50 검출기와 1× 스케줄러를 사용하여 MS COCO에서 40.7% mAP를 기록하며, 모든 기존 할당 방법을 초월한다.
  • COCO test-dev 세트에서 ResNeXt-64x4d-101-DCN와 2.5× 스케줄러를 사용하여 51.5% mAP를 달성하며, 단일 기반 검출기의 최신 기술 수준을 새롭게 설정한다.
  • 혼잡한 CrowdHuman 데이터셋에서 OTA는 46.6% MR을 기록하여 이전의 단일 기반 검출기보다 뚜렷이 뛰어나며, 이중 기반 검출기 성능에 가까워진다.
  • CrowdHuman에서 OTA는 AP와 Recall을 각각 88.4%와 95.1%로 향상시켜, 고도의 가림 상황에서도 강력한 일반화 능력을 입증한다.
  • PAA와 ATSS보다 CrowdHuman에서 뛰어난 성능을 보이며, PAA는 양성/음성 경계가 명확하지 않은 상황에서 어려움을 겪는다.
  • OT를 통한 글로벌 최적화가 모호한 앵커에서 유발되는 해로운 기울기를 효과적으로 완화하여, 더 안정적이고 정확한 훈련을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.