[논문 리뷰] Rethinking Transformer-based Set Prediction for Object Detection
이 논문은 DETR의 핵심적인 한계인 불안정한 허구란 손실과 비효율적인 교차 attention을 해결함으로써 학습 수렴 속도를 가속화하고 정확도를 향상시키는 두 가지 향상된 Transformer 기반 세트 예측 모델인 TSP-FCOS와 TSP-RCNN을 제안한다. 이 모델들은 COCO AP 점수에서 최신 기술 수준을 달성하면서도 학습 시간을 500 에포크에서 50 에포크 이내로 크게 단축시켰으며, DETR, FCOS, Faster R-CNN을 모두 초월하는 검출 정확도를 확보한다.
DETR is a recently proposed Transformer-based method which views object detection as a set prediction problem and achieves state-of-the-art performance but demands extra-long training time to converge. In this paper, we investigate the causes of the optimization difficulty in the training of DETR. Our examinations reveal several factors contributing to the slow convergence of DETR, primarily the issues with the Hungarian loss and the Transformer cross-attention mechanism. To overcome these issues we propose two solutions, namely, TSP-FCOS (Transformer-based Set Prediction with FCOS) and TSP-RCNN (Transformer-based Set Prediction with RCNN). Experimental results show that the proposed methods not only converge much faster than the original DETR, but also significantly outperform DETR and other baselines in terms of detection accuracy.
연구 동기 및 목표
- 엔드 투 엔드 Transformer 기반 객체 검출기인 DETR에서 느린 수렴의 근본 원인을 규명하는 것.
- DETR의 허구란 손실과 교차 attention 메커니즘에서 기인하는 최적화 곤란 문제를 해결하는 것.
- 후처리 단계를 제거한 Transformer 아키텍처 기반의 더 빠르고 정확도가 높은 세트 예측 모델을 개발하는 것.
- 특히 소형 객체에 대한 검출 성능을 향상시키면서 DETR보다 학습 시간을 단축시키는 것.
- 단일 모델, 단일 스케일 평가 조건에서 COCO 2017 벤치마크를 통해 제안된 모델의 유효성을 검증하는 것.
제안 방법
- FCOS와 Faster R-CNN 아키텍처를 영감으로 받아, 피처 피라미드를 갖춘 인코더 전용 DETR의 향상된 변종인 TSP-FCOS와 TSP-RCNN를 제안한다.
- TSP-FCOS에 새로운 관심 영역(FoI) 선택 메커니즘을 도입하여 Transformer 인코더 내에서의 다중 수준 피처 처리를 향상시킨다.
- 허구란 손실의 안정성과 학습 수렴 속도를 향상시키기 위해 새로운 이분 매칭 기법을 설계한다.
- 비교 분석 및 수렴 분석을 위해 랜덤 크롭 증강 없이 36 에포크(3×) 학습 스케줄을 사용한다.
- 상태 기술 모델과의 비교를 위해 DETR와 동일한 96 에포크(8×) 스케줄에 랜덤 크롭을 적용한다.
- TSP 프레임워크에 변형 가능 컨볼루션을 통합하여 호환성과 성능 향상 여부를 평가한다.

실험 결과
연구 질문
- RQ1DETR 학습 중 느린 수렴의 원인이 손실 및 주의 메커니즘 측면에서 무엇인지?
- RQ2DETR에서 교차 attention 모듈을 제거하면 소형 대비 대형 객체에 대해 성능에 어떤 영향을 미치는가?
- RQ3수정된 이분 매칭 기법이 Transformer 기반 세트 예측의 학습 안정성과 수렴 속도를 향상시킬 수 있는가?
- RQ4TSP-FCOS와 TSP-RCNN 프레임워크는 DETR 및 기준 검출기 대비 검출 정확도와 학습 속도를 어느 정도 향상시킬 수 있는가?
- RQ5TSP 모델은 변형 가능 컨볼루션과 다양한 백본 아키텍처에서 얼마나 잘 일반화되는가?
주요 결과
- TSP-RCNN는 ResNet-101-DCN을 사용해 COCO 2017에서 최신 기술 수준의 AP 51.9를 달성하여 DETR-DC5 및 기타 기준 모델을 능가한다.
- TSP-FCOS와 TSP-RCNN는 DETR의 500 에포크 대비 50 에포크 이내로 수렴하며, 더 높은 정확도를 확보한다.
- TSP-RCNN는 ResNet-101-DCN을 사용해 47.4 AP를 기록하여 동일한 학습 스케줄에서 Faster R-CNN+와 Deformable DETR를 초월한다.
- 비교 분석 결과, TSP-RCNN의 성능 향상에서 세트 예측 손실이 위치 인코딩보다 더 큰 기여를 한다는 것이 확인되었다.
- TSP-RCNN+는 ResNet-101-DCN을 사용해 51.9 AP를 기록하여 짧은 학습 스케줄 조건에서도 뛰어난 성능을 보였다.
- 제안된 모델들은 변형 가능 컨볼루션과의 강력한 호환성을 보이며, 이를 통합할 경우 성능 향상이 더욱 두드러졌다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.