[논문 리뷰] Training-Time-Friendly Network for Real-Time Object Detection
이 논문은 훈련 시간에 친화적이며 실시간 객체 검출 성능을 달성하는 TTFNet을 제안한다. 객체 중심 주변에 고밀도로 가중치가 부여된 훈련 샘플을 생성하기 위해 가우시안 커널 기반 인코딩을 사용함으로써 수렴 속도를 높여 기존 실시간 검출기인 CenterNet와 비교해 훈련 시간을 7배 이상 단축시키면서도 MS COCO에서 최고 수준의 정확도를 유지한다. 또한 추론 속도는 그대로 유지한다.
Modern object detectors can rarely achieve short training time, fast inference speed, and high accuracy at the same time. To strike a balance among them, we propose the Training-Time-Friendly Network (TTFNet). In this work, we start with light-head, single-stage, and anchor-free designs, which enable fast inference speed. Then, we focus on shortening training time. We notice that encoding more training samples from annotated boxes plays a similar role as increasing batch size, which helps enlarge the learning rate and accelerate the training process. To this end, we introduce a novel approach using Gaussian kernels to encode training samples. Besides, we design the initiative sample weights for better information utilization. Experiments on MS COCO show that our TTFNet has great advantages in balancing training time, inference speed, and accuracy. It has reduced training time by more than seven times compared to previous real-time detectors while maintaining state-of-the-art performances. In addition, our super-fast version of TTFNet-18 and TTFNet-53 can outperform SSD300 and YOLOv3 by less than one-tenth of their training time, respectively. The code has been made available at \url{https://github.com/ZJULearning/ttfnet}.
연구 동기 및 목표
- 실시간 객체 검출기에서 훈련 시간, 추론 속도, 정확도 간의 균형을 개선한다.
- CenterNet와 같은 최신 실시간 검출기에서 훈련 샘플 수가 적어 인식 신호가 부족해 수렴 속도가 느린 이유를 규명한다.
- 배치 크기나 모델 복잡도를 늘리지 않고도 효과적인 훈련 신호를 증가시키는 방법을 개발한다.
- 빠른 추론과 효율적인 훈련을 가능하게 하는 통합형 앵커 없는 검출 헤드를 설계한다.
- 특히 계산 자원이 제한된 연구자들을 고려해 최소한의 훈련 시간으로 최고 수준의 성능을 달성한다.
제안 방법
- 객체 중심 주변에 고밀도로 공간 인식이 가능한 훈련 샘플을 생성하기 위해 가우시안 커널을 사용하여 기존의 희소한 앵커 기반 또는 중심점 전용 감독 방식을 대체한다.
- 각 공간 위치에서의 가우시안 확률을 샘플 가중치로 간주하여 중심에 가까운 고품질의 샘플을 회귀에 더 강조한다.
- 작은 객체와 큰 객체 모두에서 정보를 유지하기 위해 적응형 정규화를 적용하여 감독의 모호성을 줄인다.
- 빠른 추론을 유지하기 위해 경량 헤드, 단계식, 앵커 없는 검출기 아키텍처에 가우시안 인코딩을 통합한다.
- 더 많은 효과적 훈련 샘플을 배치 크기의 대체로 활용하여 높은 학습률과 더 빠른 수렴을 가능하게 한다.
- 백본(예: ResNet 방식)에 단순 연결을 도입하여 훈련 비용을 증가시키지 않고도 특징 표현과 정밀도를 향상시킨다.
실험 결과
연구 질문
- RQ1커널 기반 인코딩을 통해 효과적 훈련 샘플 수를 늘림으로써 실시간 객체 검출기의 수렴 속도를 가속화할 수 있는가?
- RQ2실시간 검출기 중 최고 수준의 성능을 보이는 CenterNet와 같은 모델들이 빠른 추론 속도를 가짐에도 불구하고 긴 훈련 시간을 가지는 이유는 무엇인가?
- RQ3가우시안 커널 기반 샘플 인코딩이 직사각형 또는 중심점 전용 감독 방식보다 수렴 속도와 정확도 측면에서 뛰어나게 성능을 냈는가?
- RQ4제안된 방법은 기존 실시간 검출기와 비교해 훈련 시간을 크게 줄이면서도 성능을 유지하거나 향상시키는가?
- RQ5이 방법은 최소한의 사전 훈련과 제한된 계산 자원으로도 경쟁 가능한 성능을 처음부터 달성할 수 있는가?
주요 결과
- TTFNet은 CenterNet 및 기타 실시간 검출기와 비교해 훈련 시간을 7배 이상 단축시키면서도 MS COCO에서 최고 수준의 AP 점수를 달성한다.
- 초고속 TTFNet-18은 8장의 GTX 1080Ti에서 1.8시간 훈련 후 112 FPS에서 25.9 AP를 기록했으며, 이는 SSD300 훈련 시간의 10분의 1 미만이다.
- TTFNet-53은 3.1시간 훈련 후 55 FPS에서 32.9 AP를 기록했으며, YOLOv3보다 정확도와 속도 모두 뛰어나면서도 훈련 시간은 10분의 1에 불과하다.
- 장시간 훈련 버전인 TTFNet-53은 31시간 훈련 후 57 FPS에서 39.3 AP를 기록했으며, 강력한 확장성과 성능을 입증했다.
- TTFNet-18로 처음부터 훈련한 결과 19시간 후 30.3 AP를 달성했으며, 사전 훈련된 백본이 높은 성능을 내는 데 필수적이지 않음을 보여주었다.
- TTFNet의 표준 업샘플링 레이어를 CenterNet의 고유한 레이어로 교체하면 성능 향상이 가능하지만, TTFNet은 여전히 훈련 효율성과 수렴 속도 측면에서 CenterNet를 능가한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.