Skip to main content
QUICK REVIEW

[논문 리뷰] TOOD: Task-aligned One-stage Object Detection

Chengjian Feng, Yujie Zhong|arXiv (Cornell University)|2021. 08. 17.
Advanced Neural Network Applications참고 문헌 35인용 수 15
한 줄 요약

TOOD는 분류와 회귀를 명시적으로 정렬하는 작업일치 헤드(T-헤드)와 작업일치 학습(TAL)을 통해 한 단계 객체 검출기를 제안하며, 더 적은 파라미터와 FLOPs로 MS-COCO에서 51.1 AP를 달성하여 ATSS, GFL, PAA와 같은 이전의 한 단계 검출기들을 크게 앞서간다.

ABSTRACT

One-stage object detection is commonly implemented by optimizing two sub-tasks: object classification and localization, using heads with two parallel branches, which might lead to a certain level of spatial misalignment in predictions between the two tasks. In this work, we propose a Task-aligned One-stage Object Detection (TOOD) that explicitly aligns the two tasks in a learning-based manner. First, we design a novel Task-aligned Head (T-Head) which offers a better balance between learning task-interactive and task-specific features, as well as a greater flexibility to learn the alignment via a task-aligned predictor. Second, we propose Task Alignment Learning (TAL) to explicitly pull closer (or even unify) the optimal anchors for the two tasks during training via a designed sample assignment scheme and a task-aligned loss. Extensive experiments are conducted on MS-COCO, where TOOD achieves a 51.1 AP at single-model single-scale testing. This surpasses the recent one-stage detectors by a large margin, such as ATSS (47.7 AP), GFL (48.2 AP), and PAA (49.0 AP), with fewer parameters and FLOPs. Qualitative results also demonstrate the effectiveness of TOOD for better aligning the tasks of object classification and localization. Code is available at https://github.com/fcjian/TOOD.

연구 동기 및 목표

  • 분류와 회귀 예측 간의 공간 오정렬 문제를 해결하기 위해, 분류와 회귀를 병렬로 독립적으로 처리하는 헤드에서 기인하는 문제를 해결한다.
  • 분류와 회귀에 대해 일관되지 않은 최적의 앵커를 선택하는 작업 무관 표본 할당의 한계를 극복한다.
  • 새로운 기반 학습 기반 메커니즘을 통해 작업 간 상호작용과 정렬을 향상시켜 검출 성능을 향상시킨다.
  • 중복되고 잘못된 바운딩 박스를 줄임으로써 Non-Maximum Suppression(NMS)와의 더 나은 호환성을 확보한다.
  • 기존 방법들에 비해 최소한의 계산 오버헤드와 더 적은 파라미터로 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 분류와 회귀 작업 간의 상호작용을 유도하는 작업일치 특징을 계산하고, 분류와 회귀 작업 간 협업을 향상시키기 위해 작업일치 예측기(TAP)를 사용하는 작업일치 헤드(T-헤드)를 설계한다.
  • 앵커 정렬 지표를 기반으로 한 새로운 표본 할당 기반의 작업일치 학습(TAL)을 도입하여 정렬을 촉진하는 학습 샘플을 선택한다.
  • 학습 중 분류와 회귀에 대한 최적의 앵커를 점진적으로 통합하는 작업일치 손실 함수를 개발한다.
  • 정렬을 위한 공간적 특징 적응을 향상시키기 위해 헤드 타워의 첫 두 레이어에 변형 가능 컨볼루션(DCN)을 적용한다.
  • 공유된 상호작용 특징을 통해 분류와 회귀를 함께 최적화하는 다중 작업 학습 프레임워크를 사용한다.
  • 표본 할당에서 IoU 기반 및 기하학 기반 지표를 활용하여 작업 간 일관된 양성 샘플 선택을 보장한다.

실험 결과

연구 질문

  • RQ1분류와 회귀 간의 명시적 작업 정렬이 한 단계 객체 검출 성능을 향상시킬 수 있는가?
  • RQ2공유된 상호작용 헤드 아키텍처가 분류와 회귀 예측 간 공간 오정렬을 감소시키는가?
  • RQ3작업일치 손실과 표본 할당 기반으로 양 작업에 대한 최적의 앵커를 학습 중 통합할 수 있는가?
  • RQ4작업 정렬이 NMS 성능과 정확한, 중복된, 잘못된 바운딩 박스 간의 균형에 어떤 영향을 미치는가?
  • RQ5정확도, 파라미터 효율성, FLOPs 측면에서 TOOD는 기존의 한 단계 검출기들을 얼마나 뛰어나게 성능을 높일 수 있는가?

주요 결과

  • TOOD는 단일 모델, 단일 스케일 테스트 조건에서 MS-COCO에서 51.1 AP를 달성하였으며, ATSS(47.7 AP), GFL(48.2 AP), PAA(49.0 AP)를 크게 앞서나갔다.
  • ResNeXt-101-64×4d-DCN을 사용할 경우, TOOD는 51.1 AP를 기록하였으며, ATSS(48.3 → 51.1 AP)에 비해 2.8 AP 향상되었고, GFL(49.0 → 51.1 AP)에 비해 2.0 AP 향상되었다.
  • 분류와 회귀 순위 간 피어슨 상관계수(PCC)는 기준 모델의 0.408에서 T-헤드와 TAL 적용 후 0.452로 향상되어 더 나은 정렬을 의미한다.
  • 상위 10개 예측의 평균 IoU는 0.637에서 0.661로 상승하여 회귀 정확도의 일관성이 향상됨을 보여준다.
  • NMS 적용 시, TOOD는 기준 모델 대비 중복 박스를 4,186개 감소시키고 오류 박스를 23,668개 감소시켰으며, 정확한 박스 수는 473개 증가시켰다.
  • TOOD는 NMS와 뛰어난 호환성을 보이며 더 많은 정확한 검출 결과를 유지하고 더 많은 오진 및 중복 항목을 억제한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.