Skip to main content
QUICK REVIEW

[논문 리뷰] NMS Strikes Back

Jeffrey Ouyang-Zhang, Jang Hyun Cho|arXiv (Cornell University)|2022. 12. 12.
Advanced Neural Network Applications인용 수 6
한 줄 요약

이 논문은 검출 트랜스포머인 DETA를 제안하며, 엔드 투 엔드의 일대일 허긴잔 매칭을 기존의 일대다 IoU 기반 라벨 할당과 비최대 억제(NMS)로 대체한다. ResNet50를 사용해 단 12 에포크 만에 COCO에서 50.2 mAP를 달성한다. 이 방법은 더 많은 양의 양성 샘플과 향상된 학습 안정성을 바탕으로 표준 엔드 투 엔드 트랜스포머와 최신 NMS 기반 검출기보다 뛰어난 성능을 내며, 높은 성능을 내기 위해 이분할 매칭이 필수적이지 않음을 입증한다.

ABSTRACT

Detection Transformer (DETR) directly transforms queries to unique objects by using one-to-one bipartite matching during training and enables end-to-end object detection. Recently, these models have surpassed traditional detectors on COCO with undeniable elegance. However, they differ from traditional detectors in multiple designs, including model architecture and training schedules, and thus the effectiveness of one-to-one matching is not fully understood. In this work, we conduct a strict comparison between the one-to-one Hungarian matching in DETRs and the one-to-many label assignments in traditional detectors with non-maximum supervision (NMS). Surprisingly, we observe one-to-many assignments with NMS consistently outperform standard one-to-one matching under the same setting, with a significant gain of up to 2.5 mAP. Our detector that trains Deformable-DETR with traditional IoU-based label assignment achieved 50.2 COCO mAP within 12 epochs (1x schedule) with ResNet50 backbone, outperforming all existing traditional or transformer-based detectors in this setting. On multiple datasets, schedules, and architectures, we consistently show bipartite matching is unnecessary for performant detection transformers. Furthermore, we attribute the success of detection transformers to their expressive transformer architecture. Code is available at https://github.com/jozhang97/DETA.

연구 동기 및 목표

  • 일대일 이분할 매칭이 고성능 검출 트랜스포머에 실제로 필수적인가를 조사하는 것.
  • 엔드 투 엔드 검출기에서 전통적인 NMS 기반 학습과 일대다 라벨 할당의 효과성을 일대일 허긴잔 매칭과 비교하는 것.
  • 검출 트랜스포머의 성공이 아키텍처에 기인하는지 아니면 학습 목표에 기인하는지 판단하는 것.
  • 복잡한 매칭 알고리즘을 필요로 하지 않으면서도 성능을 유지하거나 향상시킬 수 있는 더 단순하고 효율적인 학습 목표를 개발하는 것.
  • 기존의 전통적 학습 목표가 현대 트랜스포머 기반 검출기에서 엔드 투 엔드 매칭을 능가할 수 있음을 보여주는 것.

제안 방법

  • Deformable-DETR의 일대일 허긴잔 매칭 손실을 첫 번째 단계 및 두 번째 단계 헤드 모두에서 일대다 IoU 기반 라벨 할당으로 대체한다.
  • 예측의 겹침을 제거하기 위해 표준 NMS를 후처리로 사용하여 기존 검출기에서 중요한 요소를 재도입한다.
  • 특히 소형 객체에 대해 학습 안정성을 향상시키기 위해, 각 참조 객체당 양성 예측 수를 제한함으로써 객체 균형 기법을 적용한다.
  • 비교를 위해 공정한 평가를 보장하기 위해 트랜스포머 인코더와 디코더 아키텍처는 Deformable-DETR와 동일하게 유지하며, 학습 목표만 변경한다.
  • 고정된 IoU 임계값(예: 0.5)을 사용하여 어느 참조 박스와도 이 임계값을 초과하는 예측 또는 쿼리에 대해 양성 라벨을 할당한다.
  • 성능와 효율성을 평가하기 위해 ResNet50 백본을 사용해 표준 1× 스케줄(12 에포크)로 모델을 훈련한다.

실험 결과

연구 질문

  • RQ1유사한 아키텍처와 학습 조건에서, NMS와 함께 일대다 라벨 할당이 일대일 허긴잔 매칭보다 검출 트랜스포머에서 성능이 뛰어나게 되는가?
  • RQ2일대다 할당이 이분할 매칭보다 뛰어난 성능을 내는 데 기여하는 핵심 요인는 무엇인가?
  • RQ3검출 트랜스포머의 성공은 주로 트랜스포머 아키텍처 때문인가, 아니면 학습 목표 때문인가?
  • RQ4복잡한 엔드 투 엔드 매칭을 대체할 수 있는 더 단순한 전통적 학습 목표가 성능 손실 없이 구현될 수 있는가?
  • RQ5객체 균형 기법은 소형 객체를 포함해 모델 수렴성과 성능에 어떤 영향을 미치는가?

주요 결과

  • DETA는 ResNet50와 1× 스케줄(12 에포크)을 사용해 COCO에서 50.2 mAP를 달성하며, 최고의 NMS 기반 검출기(42.9 mAP, CenterNet2)와 강력한 엔드 투 엔드 검출기(49.4 mAP, DINO)를 모두 능가한다.
  • Deformable-DETR에서 일대일 허긴잔 매칭에서 일대다 IoU 기반 할당으로 전환함으로써 2.5 mAP의 뚜렷한 향상이 이루어졌다.
  • 객체 균형 기법은 mAP를 1.4 포인트 향상시켰으며, 특히 소형 객체에서 가장 큰 성과(+2.7 AP)를 기록하여, 기존 매칭 방식에서의 샘플링 편향을 완화함을 시사한다.
  • 짧은 훈련 스케줄에도 불구하고 엔드 투 엔드 검출기보다 더 빠르게 수렴하고 더 높은 성능을 달성한다.
  • COCO, LVIS 등 여러 데이터셋, DETR, Deformable-DETR 등 다양한 아키텍처, 그리고 백본을 대상으로 한 실험을 통해 일관된 성능 향상이 확인되었다.
  • 절단 실험 결과, 디코더의 자체 어텐션은 DETA에 필수적이지 않지만, 크로스 어텐션은 여전히 핵심 요소로 남아 있어, 모델이 전역 최적화보다 국소적이고 쿼리 기반 추론에 더 이바지함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.