Skip to main content
QUICK REVIEW

[논문 리뷰] You Only Look One-level Feature

Qiang Chen, Ying‐Ming Wang|arXiv (Cornell University)|2021. 03. 17.
Advanced Neural Network Applications참고 문헌 51인용 수 7
한 줄 요약

이 논문은 다중 척도 특징 피라미드 대신 단일 수준의 특징 맵(C5 또는 DC5)을 사용하여 경쟁적인 정확도를 달성하는 one-stage 객체 검출기인 YOLOF를 제안한다. 다각도 인코더를 도입하여 다중 척도의 맥락을 포착하고, 균일 매칭을 통해 양성 오른쪽 할당을 균형화함으로써, YOLOF는 RetinaNet과 유사한 성능을 내며 2.5배 빠르고, 수렴 속도에서도 DETR를 능가한다. 2080Ti에서 608×608 입력으로 60fps에서 44.3 mAP를 달성한다.

ABSTRACT

This paper revisits feature pyramids networks (FPN) for one-stage detectors and points out that the success of FPN is due to its divide-and-conquer solution to the optimization problem in object detection rather than multi-scale feature fusion. From the perspective of optimization, we introduce an alternative way to address the problem instead of adopting the complex feature pyramids - {\em utilizing only one-level feature for detection}. Based on the simple and efficient solution, we present You Only Look One-level Feature (YOLOF). In our method, two key components, Dilated Encoder and Uniform Matching, are proposed and bring considerable improvements. Extensive experiments on the COCO benchmark prove the effectiveness of the proposed model. Our YOLOF achieves comparable results with its feature pyramids counterpart RetinaNet while being $2.5 imes$ faster. Without transformer layers, YOLOF can match the performance of DETR in a single-level feature manner with $7 imes$ less training epochs. With an image size of $608 imes608$, YOLOF achieves 44.3 mAP running at 60 fps on 2080Ti, which is $13\%$ faster than YOLOv4. Code is available at \url{https://github.com/megvii-model/YOLOF}.

연구 동기 및 목표

  • FPN의 성공 요인으로 다중 척도 특징 융합인지, 아니면 분할 정복 전략인지 확인하기 위해 연구한다.
  • one-stage 검출기에서 높은 성능을 내기 위해 복잡한 특징 피라미드 융합이 필수적이라는 가정을 도전한다.
  • 단일 특징 수준만을 사용하여 FPN 기반 검출기의 단순하고 효율적인 대안을 개발한다.
  • 다중 척도 맥락 부족과 오른쪽 할당 불균형 문제를 해결함으로써 단일 수준 특징 검출의 성능을 향상시킨다.
  • 트랜스포머 모듈이나 복잡한 아키텍처를 사용하지 않고도 최신의 속도-정확도 트레이드오프를 달성한다.

제안 방법

  • 백본 네트워크에서 C5 특징 맵(다운샘플링 비율 32)만을 사용하는 단일 수준 특징 검출기인 YOLOF를 제안한다.
  • 다양한 척도의 맥락을 포착하기 위해 확장된 컨볼루션을 사용한 수정된 백본인 다각도 인코더를 도입하여 추가적인 특징 수준 없이 감지 범위를 증가시킨다.
  • 특징 맵 전역에서 상위-k 최고 IoU 오른쪽을 균일하게 선택함으로써 오른쪽 할당 불균형을 줄이기 위해 균일 매칭을 활용한다.
  • 학습률 감쇠와 함께 세 단계로 나누어진 트레이닝 스케줄을 사용하며, 일반화 성능 향상을 위해 날카움 인식 최소화(SWA)를 적용한다.
  • 단일 특징 맵에서 모든 객체 척도를 커버하기 위해 각 위치에 다섯 개의 오른쪽(면적 32²에서 512², 종횡비 1)을 사용하는 수정된 오른쪽 설정을 채택한다.
  • 더 나은 양성 샘플 선택을 위해 ATSS를 k=15로 사용(기존 k=9가 아님)하며, 분석을 통해 검증한다.

실험 결과

연구 질문

  • RQ1FPN의 성공 요인으로 다중 척도 특징 융합인지, 아니면 분할 정복 전략이 더 핵심적인가?
  • RQ2명시적인 다중 척도 특징 융합 없이도 단일 특징 수준만을 사용하는 one-stage 검출기가 경쟁적인 성능을 낼 수 있는가?
  • RQ3복잡성을 추가하지 않고도 단일 수준과 다중 수준 특징 검출기 간의 성능 격차를 줄일 수 있는가?
  • RQ4FPN 기반 모델과 동등하거나 슈퍼리어한 성능을 내기 위해 단일 수준 검출기의 최적 하이퍼파라미터와 트레이닝 전략은 무엇인가?
  • RQ5트랜스포머 기반 검출기인 DETR보다 단일 수준 검출기가 더 빠르게 수렴하고 더 높은 정확도를 달성할 수 있는가?

주요 결과

  • 단일 입력, 다중 출력(SiMo) 인코더는 다중 입력, 다중 출력(MiMo, FPN) 인코더와 1 mAP 이내로 유사한 성능를 보이며, 다중 척도 특징 융합이 이전에 생각한 것만큼 필수적이지 않음을 시사한다.
  • MiSo 및 SiSo 인코더는 12 mAP 이상의 성능 저하를 보이며, 척도 기반 하위 문제 분해를 통한 분할 정복 전략이 최적화에 필수적임을 확인한다.
  • ResNet-50를 사용한 YOLOF는 COCO에서 39.2 mAP를 기록하며, RetinaNet(39.1 mAP)과 유사한 성능를 보이지만 2.5배 더 빠르다.
  • 다양한 C5(DC5, 다운샘플링 비율 16)를 사용한 YOLOF-DC5는 ResNet-101을 사용해 40.5 mAP를 달성하며 표준 YOLOF를 초월하고 17 FPS로 실행된다.
  • 2080Ti에서 608×608 입력으로 60fps에서 YOLOF는 44.3 mAP를 달성하며, YOLOv4 대비 13% 더 빠르며 강력한 속도-정확도 트레이드오프를 보인다.
  • YOLOF는 최종 성능를 동일하게 유지하면서도 DETR 대비 7배 더 빠른 에포크 수로 수렴함으로써, 트랜스포머 레이어 없이도 빠른 수렴이 가능함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.