[논문 리뷰] AO2-DETR: Arbitrary-Oriented Object Detection Transformer
AO2-DETR는 앵커와 NMS와 같은 수작업으로 설계된 구성 요소를 제거하기 위해 방향성 제안 생성, 적응형 특징 정련, 회전 인식 매칭을 도입한 새로운 엔드 투 엔드 트랜스포머 기반의 임의의 방향 오브제트 검출기이다. 가속도 기반의 쿼리와 회전 불변 특징을 활용하여 DOTA, HRSC2016, SKU110K-R에서 최신 기술 수준의 성능을 달성하며, 이전의 앵커 기반 및 단일 단계 방법들을 능가한다.
Arbitrary-oriented object detection (AOOD) is a challenging task to detect objects in the wild with arbitrary orientations and cluttered arrangements. Existing approaches are mainly based on anchor-based boxes or dense points, which rely on complicated hand-designed processing steps and inductive bias, such as anchor generation, transformation, and non-maximum suppression reasoning. Recently, the emerging transformer-based approaches view object detection as a direct set prediction problem that effectively removes the need for hand-designed components and inductive biases. In this paper, we propose an Arbitrary-Oriented Object DEtection TRansformer framework, termed AO2-DETR, which comprises three dedicated components. More precisely, an oriented proposal generation mechanism is proposed to explicitly generate oriented proposals, which provides better positional priors for pooling features to modulate the cross-attention in the transformer decoder. An adaptive oriented proposal refinement module is introduced to extract rotation-invariant region features and eliminate the misalignment between region features and objects. And a rotation-aware set matching loss is used to ensure the one-to-one matching process for direct set prediction without duplicate predictions. Our method considerably simplifies the overall pipeline and presents a new AOOD paradigm. Comprehensive experiments on several challenging datasets show that our method achieves superior performance on the AOOD task.
연구 동기 및 목표
- 앵커, NMS, 복잡한 하이퍼파ram터 등 수작업으로 설계된 구성 요소에 의존하는 앵커 기반 및 앵커 없는 방법의 한계를 해결하기 위해.
- 방향성 검출에서 앵커 생성, 변환, 비최대 억제와 같은 유도적 편향과 사전/사후 처리 단계를 제거하기 위해.
- 변형, 조밀하게 포장된, 작은 물체에 대해 정확도를 유지하면서 트랜스포머를 사용해 직접 세트 예측을 가능하게 하기 위해.
- 회전 불변 특징 학습과 방향성 쿼리 설계를 통해 회전된 물체의 특징 정렬과 표현을 향상시키기 위해.
제안 방법
- 디코더에서 주의 집중의 정렬을 향상시키기 위해 명시적인 방향성 우선 정보를 가진 물체 쿼리를 학습하는 방향성 제안 생성 메커니즘을 도입한다.
- 회전 불변 영역 특징을 추출하고, 특징과 회전된 물체 사이의 정렬 불일치를 줄이는 적응형 방향성 제안 정련 모듈을 활용한다.
- 일对일 예측 매칭을 강제하여 중복 검출을 방지하고, 회전 및 스케일 변형에 대한 일반화 성능을 향상시키기 위해 회전 인식 세트 매칭 손실을 사용한다.
- 표준 트랜스포머 인코더-디코더 아키텍처를 채택하여, 앵커 박스나 후처리 없이 학습된 물체 쿼리에서 직접적으로 방향성 바운딩 박스를 생성한다.
- 방향성 쿼리와 함께 교차 주의를 활용하여 적응적이고 순열 불변의 수신 영역을 허용하여, 비정상적인 방향성과 복잡하게 배열된 물체를 자연스럽게 처리한다.
- 디코더에서 반복적인 바운딩 박스 정밀 조정을 통해 예측을 점진적으로 향상시켜 정위치 정확도를 향상시킨다.
실험 결과
연구 질문
- RQ1앵커 박스나 수작업으로 설계된 구성 요소에 의존하지 않고도 트랜스포머 기반 검출기가 임의의 방향 오브제트 검출에서 뛰어난 성능을 낼 수 있는가?
- RQ2물체 쿼리는 어떻게 설계되어야 방향성 우선 정보를 포함하고 회전된 물체의 특징 정렬을 향상시킬 수 있는가?
- RQ3회전 인식 매칭 손실은 어떻게 작동하여 회전된 물체에 대해 정확한 일대일 예측 매칭을 가능하게 하는가?
- RQ4적응형 특징 정련은 어떻게 회전 및 조밀하게 포장된 물체의 표현 학습을 향상시키는가?
- RQ5방향성 제안과 회전 불변 특징을 갖춘 엔드 투 엔드 훈련이 기존의 앵커 없는 단일 단계 검출기보다 우수한 성능을 낼 수 있는가?
주요 결과
- AO2-DETR는 DOTA-v1.0 데이터셋에서 mAP 77.73%를 기록하여 이전의 앵커 없는 단일 단계 방법들을 크게 앞서며 성능을 뛰어나게 했다.
- 쿼리 수를 150에서 300으로 늘일수록 mAP가 68.06%에서 77.73%로 상승하여, 조밀하고 방향성이 있는 물체를 탐지하기 위해 충분한 쿼리 용량이 필수적임을 입증했다.
- 쿼리 수가 300을 초과하면 성능이 약간 감소(350과 400일 경우)하여, 과잉 쿼리가 조밀한 환경에서 검출에 간섭함을 시사한다.
- 고속 추론 성능을 유지하여, 300개 쿼리로 DOTA-v1.0에서 14.0 FPS, HRSC2016에서 16.0 FPS를 달성하여 속도와 정확도 사이의 균형을 잘 유지하고 있음을 보여주었다.
- 절단 분석 결과, 방향성 제안 생성, 적응형 정련, 회전 인식 손실이 최적 성능을 내기 위해 모두 필수적인 구성 요소임을 확인했다.
- 별도의 각도 예측 브랜치를 추가하면 성능이 77.73%에서 59.20%로 감소하여, 모든 다섯 개의 매개변수(x, y, w, h, θ)를 엔드 투 엔드로 회귀하는 것이 각도 예측을 분리하는 것보다 더 효과적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.