Skip to main content
QUICK REVIEW

[논문 리뷰] DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection

Hao Zhang, Feng Li|arXiv (Cornell University)|2022. 03. 07.
Advanced Neural Network Applications인용 수 747
한 줄 요약

DINO는 대조적 노이즈 제거 학습, 혼합 질의 초기화, 그리고 look-forward-two 메커니즘으로 DETR을 개선하여 더 작은 모델과 데이터 발자국으로 COCO에서 엔드-투-엔드 객체 탐지에서 최첨단 성능을 달성합니다. 백본 및 사전 학습 체계 전반에 걸쳐 강력한 확장성을 보여줍니다.

ABSTRACT

We present DINO ( extbf{D}ETR with extbf{I}mproved de extbf{N}oising anch extbf{O}r boxes), a state-of-the-art end-to-end object detector. % in this paper. DINO improves over previous DETR-like models in performance and efficiency by using a contrastive way for denoising training, a mixed query selection method for anchor initialization, and a look forward twice scheme for box prediction. DINO achieves $49.4$AP in $12$ epochs and $51.3$AP in $24$ epochs on COCO with a ResNet-50 backbone and multi-scale features, yielding a significant improvement of $ extbf{+6.0}$ extbf{AP} and $ extbf{+2.7}$ extbf{AP}, respectively, compared to DN-DETR, the previous best DETR-like model. DINO scales well in both model size and data size. Without bells and whistles, after pre-training on the Objects365 dataset with a SwinL backbone, DINO obtains the best results on both COCO exttt{val2017} ($ extbf{63.2}$ extbf{AP}) and exttt{test-dev} ( extbf{$ extbf{63.3}$AP}). Compared to other models on the leaderboard, DINO significantly reduces its model size and pre-training data size while achieving better results. Our code will be available at \url{https://github.com/IDEACVR/DINO}.

연구 동기 및 목표

  • NMS나 앵커와 같은 핸드크래프드 구성요소 없이 엔드-투-엔드 객체 탐지를 동기로 삼는다.
  • DETR-유사 모델의 학습 효율성 및 정확도 향상을 위한 새로운 학습 및 질의 전략을 도입한다.
  • 백본 전반과 대규모 사전 학습에서 확장성을 보여주면서 데이터/매개변수 요구를 줄인다.

제안 방법

  • 탐지기의 질의를 Transformer 프레임워크 내의 동적 4D 앵커 상자로 공식화하고 변형 가능 주의(attention)를 사용한다.
  • 강력한 일대일 매칭을 위한 양성/음성 샘플을 생성하기 위해 Contrastive DeNoising Training를 도입한다.
  • encoder 특징에서 위치 질의를 초기화하면서 콘텐츠 질의를 학습 가능하게 유지하는 혼합 질의 선택(Mixed Query Selection)을 제안한다.
  • Look Forward Twice를 구현하여 후속 계층의 그래디언트가 이전 계층의 매개변수를 미세 조정하도록 하여 더 나은 상자 예측을 가능하게 한다.

실험 결과

연구 질문

  • RQ1Contrastive denoising이 DETR-유사 모델에서 일대일 매칭을 개선하고 중복을 줄일 수 있는가?
  • RQ2혼합 질의 초기화가 콘텐츠 질의 학습 손실 없이 공간 프라이어를 향상시키는가?
  • RQ3look-forward-twice 스킴이 이후 계층에서 정제된 정보를 활용하여 초기 계층 상자 예측을 개선하는가?
  • RQ4DINO가 더 작은 백본과 대규모 사전 학습에서 기존 DETR-유사 모델과 비교해 어떤 성능을 보이는가?
  • RQ5데이터 및 모델 규모가 달라질 때 COCO에서 엔드-투-엔드 Transformer 탐지가 고전적인 탐지기와 경쟁적이거나 우수한가?

주요 결과

  • DINO는 ResNet-50로 12에폭에서 COCO val2017에서 49.0 AP(4-scale), 49.4 AP(5-scale)로, 24에폭에서 51.3 AP(5-scale)로 이전 DETR-유사 모델을 능가합니다.
  • SwinL 백본을 Objects365에서 사전 학습한 경우, DINO는 COCO val2017에서 63.2 AP, test-dev에서 63.3 AP를 달성하며 엔드-투-엔드 DETR-유사의 새로운 SOTA를 설정합니다.
  • DINO-5scale은 val2017에서 DINO-4scale보다 +0.4 AP를 보이고 test-dev에서 더 높은 AP에 도달하는 반면, 더 많은 스케일을 사용합니다; 두 구성 모두 강력한 확장성을 보여줍니다.
  • Ablation에서 CDN(대조적 노이즈 제거) 및 look-forward-twice가 최적화된 DN-DETR 및 순수 질의 선택보다 이득을 제공하며, 전체 DINO 구성이 최상의 성능을 보입니다.
  • DINO는 SwinV2-G의 모델 크기를 1/15로 축소하고 사전 학습 데이터 필요를 감소시키며(백본 1/60, 탐지 데이터 1/5) COCO 점수에서 우월한 성능을 달성합니다.
  • 소형 객체에서 벤치마크 대비 상당한 이득을 보이며(12 에폭에서 +7.5 AP)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.