Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Object Detection with Fully Convolutional Network

Jianfeng Wang, Lin Song|arXiv (Cornell University)|2020. 12. 07.
Advanced Neural Network Applications참고 문헌 57인용 수 13
한 줄 요약

이 논문은 예측 인식형 일대일(POTO) 레이블 할당과 3D 최대 필터링(3DMF)을 도입하여 완전 컨volution 네트워크를 사용하는 엔드 투 엔드 객체 검출 프레임워크를 제안한다. 이는 비최대 억제(NMS)가 필요 없도록 하여, COCO에서 NMS 기반 검출기보다 1.1% mAP 향상, CrowdHuman에서 6.0% mMR 향상하며, 혼잡한 장면에서 더 뛰어난 강건성을 확보한다.

ABSTRACT

Mainstream object detectors based on the fully convolutional network has achieved impressive performance. While most of them still need a hand-designed non-maximum suppression (NMS) post-processing, which impedes fully end-to-end training. In this paper, we give the analysis of discarding NMS, where the results reveal that a proper label assignment plays a crucial role. To this end, for fully convolutional detectors, we introduce a Prediction-aware One-To-One (POTO) label assignment for classification to enable end-to-end detection, which obtains comparable performance with NMS. Besides, a simple 3D Max Filtering (3DMF) is proposed to utilize the multi-scale features and improve the discriminability of convolutions in the local region. With these techniques, our end-to-end framework achieves competitive performance against many state-of-the-art detectors with NMS on COCO and CrowdHuman datasets. The code is available at https://github.com/Megvii-BaseDetection/DeFCN .

연구 동기 및 목표

  • 완전 컨볼루션 객체 검출기에서 엔드 투 엔드 학습 과정에서 비최대 억제(NMS)를 제거하는 것.
  • 앵커리스 검출기에서 일대다 레이블 할당으로 인한 중복 예측 문제를 해결하는 것.
  • 혼잡하고 복잡한 장면에서 특징의 구분 능력과 정렬 정확도를 향상시키는 것.
  • 수동 후처리를 대체하는 학습 가능한, 공간 인식형 모듈을 도입하여 완전 미분 가능한 학습을 가능하게 하는 것.
  • POTO와 3DMF를 활용한 엔드 투 엔드 학습이 NMS 기반 최신 기준 검출기와 비교해 경쟁력 있거나 더 뛰어난 성능을 달성할 수 있음을 입증하는 것.

제안 방법

  • 분류 및 회귀 품질의 병합을 바탕으로 각 정답에 대해 하나의 양성 샘플을 동적으로 할당하는 예측 인식형 일대일(POTO) 레이블 할당을 제안한다.
  • 이중적인, 다중 스케일 공간 필터링 모듈인 3D 최대 필터링(3DMF)을 도입하여 인접한 특징 피라미드 수준을 통해 중복 예측을 억제한다.
  • 특징 학습을 위한 충분한 감독을 제공하면서도 엔드 투 엔드 학습을 유지하기 위해 일대다 레이블 할당 기반의 보조 손실을 활용한다.
  • ResNeXt-101 및 ResNet-50 백본을 사용하여 COCO와 CrowdHuman에서 평가하기 위해 FCOS 프레임워크에 POTO와 3DMF를 통합한다.
  • 공간적 차원과 스케일 차원을 종합한 3D 최대 풀링 연산(커널 크기 φ=3, τ=2)을 통해 국소 영역의 구분 능력을 향상시킨다.
  • NMS를 학습 가능한, 미분 가능한 구성 요소로 대체하여 수동 후처리를 제거함으로써 완전한 엔드 투 엔드 최적화를 가능하게 한다.
Figure 1: As shown in the dashed box, most detectors based on the fully convolutional network adopt multiple predictions and NMS post-processing for each instance. With the proposed prediction-aware one-to-one label assignment and 3D Max Filtering, our end-to-end detector can directly perform a sing
Figure 1: As shown in the dashed box, most detectors based on the fully convolutional network adopt multiple predictions and NMS post-processing for each instance. With the proposed prediction-aware one-to-one label assignment and 3D Max Filtering, our end-to-end detector can directly perform a sing

실험 결과

연구 질문

  • RQ1완전 컨볼루션 객체 검출기에서 비최대 억제(NMS) 후처리 없이도 경쟁적인 성능을 달성할 수 있는가?
  • RQ2어떤 레이블 할당 전략이 앵커리스 검출기에서 효과적인 엔드 투 엔드 학습을 가능하게 하는가?
  • RQ3다중 스케일 특징 표현을 어떻게 활용하여 객체 검출에서 중복 예측을 줄일 수 있는가?
  • RQ4미분 가능한, 공간 인식형 필터링 메커니즘이 혼잡한 장면에서 검출 성능과 강건성을 향상시키는가?
  • RQ5POTO와 3DMF를 활용한 엔드 투 엔드 학습이 COCO와 CrowdHuman과 같은 도전적인 벤치마크에서 NMS 기반 최신 기준 검출기보다 뛰어난 성능을 낼 수 있는가?

주요 결과

  • 제안된 엔드 투 엔드 검출기는 ResNeXt-101 백본을 사용할 때 COCO에서 NMS가 포함된 FCOS보다 1.1% 높은 mAP를 달성한다.
  • CrowdHuman 데이터셋에서 이 방법은 NMS가 포함된 FCOS보다 AP50가 3.0% 높고 mMR가 6.0% 높으며, 혼잡한 장면에서 뛰어난 성능을 입증한다.
  • 엔드 투 엔드 모델의 재현율은 NMS를 적용한 정답 박스의 재현율을 초월하여, 더 나은 탐지 완전성을 보여준다.
  • 엔드 투 엔드 모델과 NMS 기반 모델 간의 성능 격차는 학습이 진행됨에 따라 줄어들며, COCO에서 180k 반복 이후 엔드 투 엔드 모델이 베이스라인 성능을 초월한다.
  • 커널 크기 φ=3 및 τ=2를 가진 3DMF가 최적의 성능을 달성하여, 중복 예측이 인접한 스케일 간의 국소 영역에서 기인한다는 것을 확인한다.
  • 계산 오버헤드가 낮게 유지되며, 베이스라인 NMS 기반 검출기 대비 약간의 증가 외에는 인퍼런스 비용이 거의 증가하지 않는다.
Figure 2: The diagram of the head with 3D Max Filtering (3DMF) in a FPN stage. ‘POTO’ indicates the proposed Prediction-aware One-to-one Label Assignment rule to achieve end-to-end detection. ‘Conv + $\sigma$ ’ denotes a convolution layer followed by a sigmoid function [ 10 ] , which outputs coarsel
Figure 2: The diagram of the head with 3D Max Filtering (3DMF) in a FPN stage. ‘POTO’ indicates the proposed Prediction-aware One-to-one Label Assignment rule to achieve end-to-end detection. ‘Conv + $\sigma$ ’ denotes a convolution layer followed by a sigmoid function [ 10 ] , which outputs coarsel

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.